Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 17 hours ago
HumanDynamics/reward_modeling_dataset upvoted a paper about 17 hours ago
Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models upvoted a paper about 17 hours ago
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific AgentsOrganizations
None yet