NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Hritik Bansal
3 papers
University of California, Los Angeles (UCLA)
LaViDa: A Large Diffusion Model for Vision-Language Understanding
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles