semantic context
- FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
- PointMapPolicy: Structured Point Cloud Processing for Multi-Modal Imitation Learning
- Practical and Effective Code Watermarking for Large Language Models
- SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions