Keze Wang
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models
- Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
- Tri-MARF: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation