RISE: Recursive Improvement via Self-Extrapolating Policy Distillation Paper • 2609.05295 • Published 4 days ago • 9
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 4 days ago • 13
MDN: Parallelizing Stepwise Momentum for Delta Linear Attention Paper • 2605.05838 • Published May 7 • 6
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 5 days ago • 166
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM Paper • 2609.04098 • Published 5 days ago • 74
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 5 days ago • 81
Post-Training Language Models for Gold-Medal Performance in Coding Competitions Paper • 2609.02849 • Published 6 days ago • 9
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model Paper • 2607.22083 • Published Jul 27 • 10
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Paper • 2608.30320 • Published 8 days ago • 53
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement Paper • 2608.31046 • Published 8 days ago • 143
Self-Improving Pretraining: using post-trained models to pretrain better models Paper • 2601.21343 • Published Jan 29 • 21
A Programming Paradigm for Spatiotemporal Composability Paper • 2608.25512 • Published 13 days ago • 16
D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation Paper • 2608.24987 • Published 14 days ago • 27
Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning Paper • 2608.23318 • Published 15 days ago • 32