Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents Paper • 2608.25417 • Published 8 days ago • 15
AdaTooler-V: Adaptive Tool-Use for Images and Videos Paper • 2512.16918 • Published Dec 18, 2025 • 14
V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval Paper • 2602.06034 • Published Feb 5 • 8
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models Paper • 2601.08689 • Published Jan 16
Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents Paper • 2608.25417 • Published 8 days ago • 15
FeatureFool: Zero-Query Fooling of Video Models via Feature Map Paper • 2510.18362 • Published Oct 22, 2025
Gen-Searcher: Reinforcing Agentic Search for Image Generation Paper • 2603.28767 • Published Mar 30 • 58
AdaTooler-V: Adaptive Tool-Use for Images and Videos Paper • 2512.16918 • Published Dec 18, 2025 • 14
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback Paper • 2506.03106 • Published Jun 3, 2025 • 6
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing Paper • 2506.09965 • Published Jun 11, 2025 • 3
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km Paper • 2510.09606 • Published Oct 10, 2025 • 18
OneThinker: All-in-one Reasoning Model for Image and Video Paper • 2512.03043 • Published Dec 2, 2025 • 35
Architecture Decoupling Is Not All You Need For Unified Multimodal Model Paper • 2511.22663 • Published Nov 27, 2025 • 29
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs Paper • 2505.21327 • Published May 27, 2025 • 83