On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 12 days ago • 199
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents Paper • 2609.32520 • Published 14 days ago • 22
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes Paper • 2610.02117 • Published 9 days ago • 24
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation Paper • 2609.39687 • Published 10 days ago • 21