Lucas Oliveira
lucasolive
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 3 hours ago
youinwww/reinforcement_learning upvoted a paper about 3 hours ago
AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation liked a dataset 1 day ago
Gene829/gene-reinforcement-learning-instructOrganizations
None yet