Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents Paper • 2608.25417 • Published 9 days ago • 17
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models Paper • 2607.08317 • Published Jul 9 • 37
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception Paper • 2606.28322 • Published Jun 26 • 43
MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training Paper • 2606.08788 • Published Jun 7 • 5
On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters Paper • 2606.02437 • Published Jun 1 • 245