vision-language-action models
Models that integrate visual, linguistic, and action-oriented components to perform tasks like robotic control or interacting with environments based on visual and textual input.
- Conditioning Matters: Training Diffusion Policies is Faster Than You Think
- Each Complexity Deserves a Pruning Policy
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization
- Real-Time Execution of Action Chunking Flow Policies
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
- SutureBot: A Precision Framework & Benchmark For Autonomous End-to-End Suturing