autonomous driving
A discipline within AI focused on developing systems that can navigate and control vehicles without human intervention. It encompasses a range of technologies including perception, decision making, and control, integrating data from various sensors like cameras and LiDAR.
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- Availability-aware Sensor Fusion via Unified Canonical Space
- CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
- COME: Adding Scene-Centric Forecasting Control to Occupancy World Model
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
- D$^2$GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction
- DINO-Foresight: Looking into the Future with DINO
- DiffE2E: Rethinking End-to-End Driving with a Hybrid Diffusion-Regression-Classification Policy
- DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
- DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving
- Embodied Cognition Augmented End2End Autonomous Driving
- Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation
- Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution
- GaussianFusion: Gaussian-Based Multi-Sensor Fusion for End-to-End Autonomous Driving
- HCRMP: An LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving
- Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
- Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- Model-Based Policy Adaptation for Closed-Loop End-to-end Autonomous Driving
- More effort is needed to protect pedestrian privacy in the era of AI
- MuSLR: Multimodal Symbolic Logical Reasoning
- OpenBox: Annotate Any Bounding Boxes in 3D
- Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- Predictive Preference Learning from Human Interventions
- Prioritizing Perception-Guided Self-Supervision: A New Paradigm for Causal Modeling in End-to-End Autonomous Driving
- QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction
- RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- RayFusion: Ray Fusion Enhanced Collaborative Visual Perception
- STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving
- SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
- T-norm Selection for Object Detection in Autonomous Driving with Logical Constraints
- Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
- TopoPoint: Enhance Topology Reasoning via Endpoint Detection in Autonomous Driving
- UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning
- Unifying Appearance Codes and Bilateral Grids for Driving Scene Gaussian Splatting
- V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception
- WorldModelBench: Judging Video Generation Models As World Models
- X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability