Towards Quantifying Benchmark Optimization in ASR Models Paper • 2608.19936 • Published 14 days ago • 12
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis Paper • 2608.18940 • Published 15 days ago • 34
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation Paper • 2608.07463 • Published 27 days ago • 6
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 28 days ago • 35
Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills Paper • 2608.01851 • Published Aug 3 • 12
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval Paper • 2608.06060 • Published 28 days ago • 40