Chidi Okafor
cokafor
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model about 4 hours ago
RLHFlow/pair-preference-model-LLaMA3-8B liked a model about 4 hours ago
jaehyeokdoo2/openpi-droid-pnpcarrot-singetask-qflow-offlinerl-criticwarmup2000-alpha100-bs8-test upvoted a paper about 4 hours ago
All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-ExpertsOrganizations
None yet