LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures Paper • 2610.04292 • Published 6 days ago • 38
Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym Paper • 2609.37267 • Published 10 days ago • 40
Covert Assistance: Helpful LLM Agents Evade Oversight in Multi-Agent Systems Paper • 2609.39050 • Published 9 days ago • 18
Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It Paper • 2610.03195 • Published 7 days ago • 45
VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks Paper • 2610.00972 • Published 8 days ago • 58
EditHero: A Benchmark for Long-Horizon Part-Level 3D Editing and Vibe Modeling Paper • 2610.02298 • Published 8 days ago • 58
OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning Paper • 2610.02181 • Published 8 days ago • 22
ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization Paper • 2610.00906 • Published 8 days ago • 83
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes Paper • 2610.02117 • Published 8 days ago • 23
EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making Paper • 2609.38334 • Published 8 days ago • 80
SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation Paper • 2609.37539 • Published 10 days ago • 12
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks Paper • 2609.38288 • Published 10 days ago • 143
More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models Paper • 2609.38827 • Published 9 days ago • 61
AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation Paper • 2609.35530 • Published 11 days ago • 22
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents Paper • 2609.27334 • Published 16 days ago • 56
ExpVoyager: Direct Experience Navigation for Dynamic Agent Skill Synthesis Paper • 2609.32630 • Published 13 days ago • 19