Towards Quantifying Benchmark Optimization in ASR Models Paper • 2608.19936 • Published 3 days ago • 8
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis Paper • 2608.18940 • Published 4 days ago • 32
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 22 days ago • 261
MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation Paper • 2608.07463 • Published 16 days ago • 6
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 17 days ago • 35
Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills Paper • 2608.01851 • Published 20 days ago • 12
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval Paper • 2608.06060 • Published 17 days ago • 40