Evaluating Stochasticity in Deep Research Agents
Haotian Zhai, Elias Stengel-Eskin, Pratik Patil, Liu Leqi
arXiv 2026
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
Manas Pathak, Xingyao Chen, Shuozhe Li,, Amy Zhang, Liu Leqi
COLM 2026
EquivaMap: Leveraging LLMs for Automatic Equivalence Checking of Optimization Formulations
Haotian Zhai, Connor Lawless, Ellen Vitercik, Liu Leqi
ICML 2025
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
Ruiyang Zhou, Shuozhe Li, Amy Zhang, Liu Leqi
Neurips 2025
Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models
Arxiv 2025