action prediction
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation