RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 9 days ago • 278
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 14 days ago • 326
Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics Paper • 2609.36608 • Published 11 days ago • 8
PMOPD: Task Ordering, Cycling, and Parameter-Update Subspace Protection in Multi-Teacher On-Policy Distillation Paper • 2609.34605 • Published 12 days ago • 12
Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning Paper • 2608.19669 • Published 11 days ago • 6