DecepEval: A Benchmark for Evaluating Deception in LLM Agents Paper • 2610.07967 • Published 5 days ago • 75
RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement Paper • 2609.39045 • Published 11 days ago • 94
A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal Paper • 2609.21996 • Published 23 days ago • 9