Selecting Diverse SFT Traces Improves Post-RL Generalization Paper • 2609.33780 • Published 6 days ago • 37
Unlocking Lossless Speedups in LLMs via Discrete Diffusion Paper • 2609.04010 • Published about 1 month ago • 114
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards Paper • 2605.10899 • Published May 11 • 78 • 3
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards Paper • 2605.10899 • Published May 11 • 78