arxiv:2604.14148
fulong ye
Alon77777
AI & ML interests
vision and language, diffusion model, text-to-image generation, image-to-text generation, referring expression generation and comprehension
Recent Activity
liked a model about 20 hours ago
LightOriginsHQ/Light-O1-Preview upvoted a paper 21 days ago
LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation authored a paper 5 months ago
SPRING: Situated Conversation Agent Pretrained with Multimodal Questions
from Incremental Layout Graph