arxiv:2310.02003
Max Ruiz Luyten
maxruizluyten
AI & ML interests
None yet
Recent Activity
upvoted a paper 4 days ago
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics upvoted a paper 4 months ago
Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients commentedon a paper 9 months ago
GameTalk: Training LLMs for Strategic ConversationOrganizations
None yet