DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training Paper • 2609.04094 • Published 4 days ago • 25
An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code Generation Paper • 2505.20182 • Published May 26, 2025
ResearchCodeAgent: An LLM Multi-Agent System for Automated Codification of Research Methodologies Paper • 2504.20117 • Published Apr 28, 2025 • 1
When Agents go Astray: Course-Correcting SWE Agents with PRMs Paper • 2509.02360 • Published Oct 21, 2025
Steer, Don't Solve: Training Small Critic Models for Large Code Agents Paper • 2606.21811 • Published Jun 20 • 1
code-critic-model/Qwen3-8B-Critic-SFT-Detailed-Prompt Text Generation • 1B • Updated 4 days ago • 340
Steer, Don't Solve: critic models and data Collection Critic models and SFT corpora from 'Steer, Don't Solve: Training Small Critic Models for Large Code Agents' (arXiv 2606.21811). • 12 items • Updated 4 days ago