reinforcement learning
A machine learning paradigm where an agent learns to make decisions by performing actions in an environment to maximize cumulative rewards over time; feedback is provided in the form of rewards or penalties.
- $Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
- $\texttt{G1}$: Teaching LLMs to Reason on Graphs with Reinforcement Learning
- 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
- 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
- A Differential and Pointwise Control Approach to Reinforcement Learning
- A Generalized Bisimulation Metric of State Similarity between Markov Decision Processes: From Theoretical Propositions to Applications
- A Principled Path to Fitted Distributional Evaluation
- A Reinforcement Learning-based Bidding Strategy for Data Consumers in Auction-based Federated Learning
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
- A Temporal Difference Method for Stochastic Continuous Dynamics
- ALINE: Joint Amortization for Bayesian Inference and Active Data Acquisition
- AMBER: Adaptive Mesh Generation by Iterative Mesh Resolution Prediction
- AREAL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
- ARIA: Training Language Agents with Intention-driven Reward Aggregation
- Absolute Zero: Reinforced Self-play Reasoning with Zero Data
- Accelerating RL for LLM Reasoning with Optimal Advantage Regression
- AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
- Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
- Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
- Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
- AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking
- Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
- Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural Networks
- Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural Networks
- Adversarial Diffusion for Robust Reinforcement Learning
- AegisGuard: RL-Guided Adapter Tuning for TEE-Based Efficient & Secure On-Device Inference
- Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- Aligning Transformers with Continuous Feedback via Energy Rank Alignment
- AlphaZero Neural Scaling and Zipf's Law: a Tale of Board Games and Power Laws
- Among Us: A Sandbox for Measuring and Detecting Agentic Deception
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- Approximating Shapley Explanations in Reinforcement Learning
- Ask a Strong LLM Judge when Your Reward Model is Uncertain
- Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
- Automaton Constrained Q-Learning
- Avoiding exp(R) scaling in RLHF through Preference-based Exploration
- BLEUBERI: BLEU is a surprisingly effective reward for instruction following
- BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
- Behavior Injection: Preparing Language Models for Reinforcement Learning
- Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
- Beyond Least Squares: Uniform Approximation and the Hidden Cost of Misspecification
- Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
- BioReason: Incentivizing Multimodal Biological Reasoning within a DNA-LLM Model
- Blending Complementary Memory Systems in Hybrid Quadratic-Linear Transformers
- Bootstrap Off-policy with World Model
- Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
- Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
- CAD-Coder: Text-to-CAD Generation with Chain-of-Thought and Geometric Reward
- CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
- CORE: Collaborative Optimization with Reinforcement Learning and Evolutionary Algorithm for Floorplanning
- CURE: Co-Evolving Coders and Unit Testers via Reinforcement Learning
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- Capturing Individual Human Preferences with Reward Features
- Causality Meets Locality: Provably Generalizable and Scalable Policy Learning for Networked Systems
- Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
- Certifying Stability of Reinforcement Learning Policies using Generalized Lyapunov Functions
- Checklists Are Better Than Reward Models For Aligning Language Models
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Reinforcement Learning
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Complexity Scaling Laws for Neural Models using Combinatorial Optimization
- Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data
- Computational Hardness of Reinforcement Learning with Partial $q^{\pi}$-Realizability
- Conformal Prediction Beyond the Horizon: Distribution-Free Inference for Policy Evaluation
- Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
- Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
- Continual Knowledge Adaptation for Reinforcement Learning
- Continuous Q-Score Matching: Diffusion Guided Reinforcement Learning for Continuous-Time Control
- Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning
- Counteractive RL: Rethinking Core Principles for Efficient and Scalable Deep Reinforcement Learning
- Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs
- Cypher-RI: Reinforcement Learning for Integrating Schema Selection into Cypher Generation
- DAPO : Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage-Based Policy Optimization
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- DCcluster-Opt: Benchmarking Dynamic Multi-Objective Optimization for Geo-Distributed Data Center Workloads
- DEAL: Diffusion Evolution Adversarial Learning for Sim-to-Real Transfer
- DeepDiver: Adaptive Web-Search Intensity Scaling via Reinforcement Learning
- DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- DexGarmentLab: Dexterous Garment Manipulation Environment with Generalizable Policy
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
- Diversity-Aware Policy Optimization for Large Language Model Reasoning
- Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- Don’t Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
- Doubly Robust Alignment for Large Language Models
- Dynamic Configuration for Cutting Plane Separators via Reinforcement Learning on Incremental Graph
- DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented Generation
- Dynamics-Aligned Latent Imagination in Contextual World Models for Zero-Shot Generalization
- EDELINE: Enhancing Memory in Diffusion-based World Models via Linear-Time Sequence Modeling
- EVAAA: A Virtual Environment Platform for Essential Variables in Autonomous and Adaptive Agents
- Efficient Preference-Based Reinforcement Learning: Randomized Exploration meets Experimental Design
- Efficient and Near-Optimal Algorithm for Contextual Dueling Bandits with Offline Regression Oracles
- Eliciting Reasoning in Language Models with Cognitive Tools
- Enhancing Tactile-based Reinforcement Learning for Robotic Control
- Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
- EvoLM: In Search of Lost Language Model Training Dynamics
- EvoLM: In Search of Lost Language Model Training Dynamics
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
- Explainable Reinforcement Learning from Human Feedback to Improve Alignment
- Explainably Safe Reinforcement Learning
- Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Finite Sample Analysis of Linear Temporal Difference Learning with Arbitrary Features
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
- Flexible inference for animal learning rules using neural networks
- Flow-Based Policy for Online Reinforcement Learning
- Flow-GRPO: Training Flow Matching Models via Online RL
- GLID$^2$E: A Gradient-Free Lightweight Fine-tune Approach for Discrete Biological Sequence Design
- GRIT: Teaching MLLMs to Think with Images
- GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
- General-Reasoner: Advancing LLM Reasoning Across All Domains
- Generalizing Verifiable Instruction Following
- Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
- Globally Optimal Policy Gradient Algorithms for Reinforcement Learning with PID Control Policies
- GoalLadder: Incremental Goal Discovery with Vision-Language Models
- GraphChain: Large Language Models for Large-scale Graph Analysis via Tool Chaining
- Greedy Sampling Is Provably Efficient For RLHF
- Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data
- Grounded Reinforcement Learning for Visual Reasoning
- Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
- Gymnasium: A Standard Interface for Reinforcement Learning Environments
- HCRMP: An LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving
- Hadamax Encoding: Elevating Performance in Model-Free Atari
- Heterogeneous Graph Transformers for Simultaneous Mobile Multi-Robot Task Allocation and Scheduling under Temporal Constraints
- Hierarchical Optimization via LLM-Guided Objective Evolution for Mobility-on-Demand Systems
- How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
- How Far Are We from Optimal Reasoning Efficiency?
- Hybrid Latent Reasoning via Reinforcement Learning
- Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs
- Imitation Beyond Expectation Using Pluralistic Stochastic Dominance
- Imitation Learning with Temporal Logic Constraints
- Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
- Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
- Improving Monte Carlo Tree Search for Symbolic Regression
- Improving Regret Approximation for Unsupervised Dynamic Environment Generation
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- Improving Reward Models with Proximal Policy Exploration for Preference-Based Reinforcement Learning
- Improving Video Generation with Human Feedback
- Incentivizing LLMs to Self-Verify Their Answers
- Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
- Incremental Sequence Classification with Temporal Consistency
- Information-Theoretic Reward Decomposition for Generalizable RLHF
- Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics
- Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
- Iterative Foundation Model Fine-Tuning on Multiple Rewards
- Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
- KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- LC-Opt: Benchmarking Reinforcement Learning and Agentic AI for End-to-End Liquid Cooling Optimization in Data Centers
- LILO: Learning to Reason at the Frontier of Learnability
- LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models
- LaRes: Evolutionary Reinforcement Learning with LLM-based Adaptive Reward Search
- Latent Mixture of Symmetries for Sample-Efficient Dynamic Learning
- Learning Human-Like RL Agents Through Trajectory Optimization With Action Quantization
- Learning Interestingness in Automated Mathematical Theory Formation
- Learning Preferences without Interaction for Cooperative AI: A Hybrid Offline-Online Approach
- Learning from A Single Markovian Trajectory: Optimality and Variance Reduction
- Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models
- Learning to Clean: Reinforcement Learning for Noisy Label Correction
- Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
- MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering
- MMaDA: Multimodal Large Diffusion Language Models
- MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
- MTL-KD: Multi-Task Learning Via Knowledge Distillation for Generalizable Neural Vehicle Routing Solver
- MURKA: Multi-Reward Reinforcement Learning with Knowledge Alignment for Optimization Tasks
- Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning
- Memory-Enhanced Neural Solvers for Routing Problems
- Meta-learning how to Share Credit among Macro-Actions
- MetaBox-v2: A Unified Benchmark Platform for Meta-Black-Box Optimization
- Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
- Multi-Agent Collaboration via Evolving Orchestration
- Multi-Agent Reinforcement Learning with Communication-Constrained Priors
- Nabla-R2D3: Effective and Efficient 3D Diffusion Alignment with 2D Rewards
- Near-Optimal Sample Complexity for Online Constrained MDPs
- No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
- NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- Non-convex entropic mean-field optimization via Best Response flow
- Normalizing Flows are Capable Models for Continuous Control
- Novel Exploration via Orthogonality
- OPHR: Mastering Volatility Trading with Multi-Agent Deep Reinforcement Learning
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- Off-policy Reinforcement Learning with Model-based Exploration Augmentation
- Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
- On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization
- On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
- On the Sample Complexity of Differentially Private Policy Optimization
- On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
- One Subgoal at a Time: Zero-Shot Generalization to Arbitrary Linear Temporal Logic Requirements in Multi-Task Reinforcement Learning
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- Open-World Drone Active Tracking with Goal-Centered Rewards
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Optimal Dynamic Regret by Transformers for Non-Stationary Reinforcement Learning
- Optimal Regret Bounds via Low-Rank Structured Variation in Non-Stationary Reinforcement Learning
- Optimizing Anytime Reasoning via Budget Relative Policy Optimization
- OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning
- Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits
- PARCO: Parallel AutoRegressive Models for Multi-Agent Combinatorial Optimization
- Parameter Efficient Fine-tuning via Explained Variance Adaptation
- Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Periodic Skill Discovery
- Personalized Exercise Recommendation with Semantically-Grounded Knowledge Tracing
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Policy Optimized Text-to-Image Pipeline Design
- ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
- Progress Reward Model for Reinforcement Learning via Large Language Models
- Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs
- ProtoPairNet: Interpretable Regression through Prototypical Pair Reasoning
- Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation
- Proxy Target: Bridging the Gap Between Discrete Spiking Neural Networks and Continuous Control
- PurpCode: Reasoning for Safer Code Generation
- Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
- QiMeng-SALV: Signal-Aware Learning for Verilog Code Generation
- QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
- RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
- RAST: Reasoning Activation in LLMs via Small-model Transfer
- RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
- RLVR-World: Training World Models with Reinforcement Learning
- RLZero: Direct Policy Inference from Language Without In-Domain Supervision
- Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models
- ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
- ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
- Reasoning Gym: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
- Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
- Reasoning Models Sometimes Output Illegible Chains of Thought
- Reasoning as an Adaptive Defense for Safety
- Rectifying Shortcut Behaviors in Preference-based Reward Learning
- Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference
- ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
- Reinforced Context Order Recovery for Adaptive Reasoning and Planning
- Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- Reinforcement Learning Teachers of Test Time Scaling
- Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding
- Reinforcement Learning for Reasoning in Large Language Models with One Training Example
- Reinforcement Learning with Action Chunking
- Reinforcement Learning with Backtracking Feedback
- Reinforcement Learning with Imperfect Transition Predictions: A Bellman-Jensen Approach
- Reinforcement learning for one-shot DAG scheduling with comparability identification and dense reward
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Retro-R1: LLM-based Agentic Retrosynthesis
- Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
- Reverse Engineering Human Preferences with Reinforcement Learning
- Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective
- Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
- Revolutionizing Training-Free NAS: Towards Efficient Automatic Proxy Discovery via Large Language Models
- Reward-Aware Proto-Representations in Reinforcement Learning
- Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization
- Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- Robust Reinforcement Learning in Finance: Modeling Market Impact with Elliptic Uncertainty Sets
- Robust and Scalable Autonomous Reinforcement Learning in Irreversible Environments
- Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
- SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation
- SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
- SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
- SE-GUI: Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- SPiDR: A Simple Approach for Zero-Shot Safety in Sim-to-Real Transfer
- SQL-R1: Training Natural Language to SQL Reasoning Model By Reinforcement Learning
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
- SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
- SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
- Scaffolding Dexterous Manipulation with Vision-Language Models
- Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
- Scaling RL to Long Videos
- SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
- SeRL: Self-play Reinforcement Learning for Large Language Models with Limited Data
- Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
- Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
- Seeing the Arrow of Time in Large Multimodal Models
- Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
- Self-Challenging Language Model Agents
- Self-Improving Embodied Foundation Models
- Self-Verifying Reflection Helps Transformers with CoT Reasoning
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- Sequential Attention-based Sampling for Histopathological Analysis
- Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
- ShiQ: Bringing back Bellman to LLMs
- Shift Before You Learn: Enabling Low-Rank Representations in Reinforcement Learning
- ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning
- Solving Continuous Mean Field Games: Deep Reinforcement Learning for Non-Stationary Dynamics
- Spatial-Aware Decision-Making with Ring Attractors in Reinforcement Learning Systems
- Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning
- State Entropy Regularization for Robust Reinforcement Learning
- State Entropy Regularization for Robust Reinforcement Learning
- State-Covering Trajectory Stitching for Diffusion Planners
- Steering Generative Models with Experimental Data for Protein Fitness Optimization
- Strategyproof Reinforcement Learning from Human Feedback
- Structured Reinforcement Learning for Combinatorial Decision-Making
- Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control
- SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
- SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- TTRL: Test-Time Reinforcement Learning
- Tapered Off-Policy REINFORCE - Stable and efficient reinforcement learning for large language models
- Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
- Teaching Language Models to Reason with Tools
- Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
- Temporal Representation Alignment: Successor Features Enable Emergent Compositionality in Robot Instruction Following
- Temporal-Difference Variational Continual Learning
- TensorRL-QAS: Reinforcement learning with tensor networks for improved quantum architecture search
- The Overthinker's DIET: Cutting Token Calories with DIfficulty-AwarE Training
- The Promise of RL for Autoregressive Image Editing
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
- The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
- Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
- Think before Recommendation: Autonomous Reasoning-enhanced Recommender
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- Thinker: Learning to Think Fast and Slow
- Thinkless: LLM Learns When to Think
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable RL
- ToolRL: Reward is All Tool Learning Needs
- Towards Generalizable Multi-Policy Optimization with Self-Evolution for Job Scheduling
- Towards Principled Unsupervised Multi-Agent Reinforcement Learning
- Towards Provable Emergence of In-Context Reinforcement Learning
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Train on Pins and Test on Obstacles for Rectilinear Steiner Minimum Tree
- Training Language Models to Generate Quality Code with Program Analysis Feedback
- Training a Scientific Reasoning Model for Chemistry
- Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
- Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
- Trajectory Graph Learning: Aligning with Long Trajectories in Reinforcement Learning Without Reward Design
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
- URB - Urban Routing Benchmark for RL-equipped Connected Autonomous Vehicles
- Uncertainty-Based Smooth Policy Regularisation for Reinforcement Learning with Few Demonstrations
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Understanding Data Influence in Reinforcement Finetuning
- Uni-RL: Unifying Online and Offline RL via Implicit Value Regularization
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Unlocking Multimodal Mathematical Reasoning via Process Reward Model
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VIKI‑R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VPO: Reasoning Preferences Optimization Based on $\mathcal{V}$-Usable Information
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- Value Diffusion Reinforcement Learning
- Value-Guided Decision Transformer: A Unified Reinforcement Learning Framework for Online and Offline Settings
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
- Vinci: Deep Thinking in Text-to-Image Generation using Unified Model with Reinforcement Learning
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
- VolleyBots: A Testbed for Multi-Drone Volleyball Game Combining Motion Control and Strategic Play
- Volume Transmission Implements Context Factorization to Target Online Credit Assignment and Enable Compositional Generalization
- WHAT MAKES MATH PROBLEMS HARD FOR REINFORCEMENT LEARNING: A CASE STUDY
- WebDancer: Towards Autonomous Information Seeking Agency
- What Can RL Bring to VLA Generalization? An Empirical Study
- What Makes a Reward Model a Good Teacher? An Optimization Perspective
- When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
- World Models as Reference Trajectories for Rapid Motor Adaptation
- Zero-shot World Models via Search in Memory
- Zeroth-Order Optimization Finds Flat Minima