vision-language benchmarks
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
- Unified Reinforcement and Imitation Learning for Vision-Language Models