SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning Paper • 2608.23493 • Published 20 days ago • 1
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 11 days ago • 120
view post Post 71 You don't have to run an agent evaluation to the end. An agent's final outcome is usually visible from its early behavior, so we just stop the run once it's clear. EarlyEval cuts 13% to 26% of steps and up to 44% of input tokens, and resolve rates move by only 1 to 2 points. EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction (2609.02783)https://github.com/inphotoo/earlyeval See translation 🔥 1 1 + Reply
SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning Paper • 2608.23493 • Published 20 days ago • 1
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 11 days ago • 120
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 11 days ago • 120
CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild Paper • 2608.23181 • Published 20 days ago • 34
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence Paper • 2608.16425 • Published 26 days ago • 40
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence Paper • 2608.16425 • Published 26 days ago • 40
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence Paper • 2608.16425 • Published 26 days ago • 40
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published Aug 10 • 136
Rethinking Code Complexity Through the Lens of Large Language Models Paper • 2602.07882 • Published May 27
SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution Paper • 2608.18933 • Published 25 days ago • 13
SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution Paper • 2608.18933 • Published 25 days ago • 13
Second Thought: Reasoning in Parallel as LLM Agents Act and Observe Paper • 2608.13667 • Published 30 days ago • 17
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published Aug 10 • 136
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published Aug 10 • 136
Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents? Paper • 2607.01211 • Published Jul 1 • 14