SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models Paper • 2609.02886 • Published 22 days ago • 117
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments Paper • 2609.04148 • Published 21 days ago • 245
HarnessEval-W: Agentifying the Evaluation of Visual Worlds Paper • 2608.16859 • Published Aug 17 • 122
JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles Paper • 2607.27670 • Published Aug 4 • 9
UniWorld-Design: From Pixel Generation to Layer-Native Design Paper • 2608.03971 • Published Aug 4 • 25
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published Aug 3 • 188
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications Paper • 2607.28617 • Published Jul 30 • 37
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications Paper • 2607.28617 • Published Jul 30 • 37
Can AI agents conduct open-ended AI research? Early evidence from two case studies Paper • 2607.27191 • Published Jul 29 • 18