HUMAIN Lab

Evaluating Stochasticity in Deep Research Agents

Haotian Zhai, Elias Stengel-Eskin, Pratik Patil, Liu Leqi

arXiv 2026

PDF

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

Manas Pathak, Xingyao Chen, Shuozhe Li,, Amy Zhang, Liu Leqi

COLM 2026

PDF

EquivaMap: Leveraging LLMs for Automatic Equivalence Checking of Optimization Formulations

Haotian Zhai, Connor Lawless, Ellen Vitercik, Liu Leqi

ICML 2025

PDF

ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning

Ruiyang Zhou, Shuozhe Li, Amy Zhang, Liu Leqi

Neurips 2025

PDF

Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models

Arxiv 2025

PDF