The SFT+RL+OPD model weights of paper "To mix or to merge: Toward multi-domain reinforcement learning for large language models"
Haoqing wang
Jackwang111
AI & ML interests
None yet
Recent Activity
liked a model about 23 hours ago
Jackwang111/M2RL-RL_Agent liked a model 2 days ago
Jackwang111/M2RL-RL_Coding liked a model 2 days ago
Jackwang111/M2RL-SFTOrganizations
None yet