multimodal large language model
A type of language model designed to understand and generate responses that integrate information from various modalities, including text, images, and audio, thereby improving interaction and understanding across diverse contexts.
- BackdoorDM: A Comprehensive Benchmark for Backdoor Learning on Diffusion Model
- CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step
- GoT: Unleashing Reasoning Capability of MLLM for Visual Generation and Editing
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
- LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds
- OmniGaze: Reward-inspired Generalizable Gaze Estimation in the Wild
- OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
- OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection
- OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
- OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
- Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models
- ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
- UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP