ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals Paper • 2609.16816 • Published 6 days ago • 10
MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control Paper • 2609.06251 • Published 16 days ago • 7
Continual Learning Mechanisms Compose for Long-Horizon Memorization Paper • 2609.06986 • Published 14 days ago • 364
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents Paper • 2609.06702 • Published 15 days ago • 26
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks Paper • 2609.11042 • Published 11 days ago • 62
DataFlex-RL: An Evaluation Platform for RLVR Data Policies Paper • 2609.06107 • Published 16 days ago • 162
Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models Paper • 2609.13680 • Published 9 days ago • 11
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents Paper • 2609.17523 • Published 6 days ago • 30
Expert-Space Exploration in MoE Reinforcement Learning Paper • 2609.13058 • Published 10 days ago • 7
MInTRL: Off-policy Intervention can boost On-policy RL Paper • 2609.12419 • Published 10 days ago • 13
Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training Paper • 2609.15051 • Published 7 days ago • 14
Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation Paper • 2609.11638 • Published 11 days ago • 690
Srishti280992/repro-exact-unlearning-in-reinforcement-learning-traces Traces • Updated Aug 3 • 58 • 2