Submitted by Jinjing Zhao 112 Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models Microsoft 4
Submitted by Miaosen Zhang 17 Covering Human Action Space for Computer Use: Data Synthesis and Benchmark Microsoft 35 2
Submitted by Baolin Peng 21 Synthetic Computers at Scale for Long-Horizon Productivity Simulation Microsoft 2
Submitted by Sebastian Ehlert 6 Accurate and scalable exchange-correlation with deep learning Microsoft 258 2
Submitted by tan 4 Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks Microsoft 3 2
Submitted by Aditya Kanade 8 Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization Microsoft 2
Submitted by ZHOU 5 AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation Microsoft 31 2
Submitted by Haozhe Qi 8 AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding Microsoft 4 2
Submitted by Kevin Qu 15 Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models Microsoft 49 3
Submitted by JeonghyeKim 37 Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization Microsoft 3