vision-language-action
Vision-language-action refers to AI frameworks that integrate visual input and natural language processing to enable machines to understand and interact with the world, often leading to applications like robotic manipulation based on visual and textual instructions.
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
- ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
- FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators