DecepEval: A Benchmark for Evaluating Deception in LLM Agents Paper • 2610.07967 • Published 4 days ago • 49
Self-Supervised Scaling of Terminal Environments for Scientific Domains Paper • 2610.02710 • Published 8 days ago • 13
ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization Paper • 2610.00906 • Published 9 days ago • 83
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents Paper • 2609.17632 • Published 25 days ago • 46
Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning Paper • 2609.10445 • Published Sep 9 • 35