lms-shape-preferences/wildchat-intents-qwen3-32b Viewer • Updated 24 days ago • 307k • 18 • 1
lms-shape-preferences/wildchat-intents-qwen3-32b Viewer • Updated 24 days ago • 307k • 18 • 1
Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs Paper • 2402.14740 • Published Feb 22, 2024 • 18