Yu-Gang Jiang
- Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
- ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
- HumanoidGen: Data Generation for Bimanual Dexterous Manipulation via LLM Reasoning
- INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
- OmniGen-AR: AutoRegressive Any-to-Image Generation
- OmniSVG: A Unified Scalable Vector Graphics Generation Model
- SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
- SafeVid: Toward Safety Aligned Video Large Multimodal Models
- TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making