Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards Paper • 2609.36864 • Published 3 days ago • 9
Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards Paper • 2609.36864 • Published 3 days ago • 9
Towards Full Pipeline FP8 Reinforcement Learning for LLMs Paper • 2609.22870 • Published 13 days ago • 17
Towards Full Pipeline FP8 Reinforcement Learning for LLMs Paper • 2609.22870 • Published 13 days ago • 17
PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution Paper • 2601.10657 • Published Jan 15 • 20
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense Paper • 2510.07242 • Published Oct 8, 2025 • 30