multi-modal large language models
Language models that can handle and integrate multiple types of data, such as text, images, and audio. These models typically leverage techniques from natural language processing and computer vision to understand and generate content across modalities.
- Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
- ESCA: Contextualizing Embodied Agents via Scene-Graph Generation
- EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis
- Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
- Generative RLHF-V: Learning Principles from Multi-modal Human Preference
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- Multi-step Visual Reasoning with Visual Tokens Scaling and Verification
- Panoptic Captioning: An Equivalence Bridge for Image and Text
- Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
- RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts
- RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models
- To Think or Not To Think: A Study of Thinking in Rule-Based Visual Reinforcement Fine-Tuning
- Walking the Tightrope: Autonomous Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning
- Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs