NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Xiaoyu Liu
3 papers
Shanghai University
ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs