Karthik Iyer
kiyer97
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 11 hours ago
youinwww/reinforcement_learning upvoted a paper about 11 hours ago
Towards Full Pipeline FP8 Reinforcement Learning for LLMs upvoted a paper about 11 hours ago
ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action ModelsOrganizations
None yet