multi-modal reasoning
- Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
- InstructHOI: Context-Aware Instruction for Multi-Modal Reasoning in Human-Object Interaction Detection
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching