M2RL Collection The SFT+RL+OPD model weights of paper "To mix or to merge: Toward multi-domain reinforcement learning for large language models" • 8 items • Updated 4 days ago • 1