From Pixels to Words -- Towards Native One-Vision Models at Scale
Haiwen Diao
Paranioar
AI & ML interests
Vision-and-Language, Parameter-efficient Transfer Learning, Multi-modal Large Language Model
Recent Activity
upvoted a paper 1 day ago
Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement authored a paper 8 days ago
Looped Diffusion Transformer authored a paper 8 days ago
Think Before You Score: Thinking Reward Model for Visual Generation