supervised fine-tuning
The process of updating a pre-trained model using labeled data for a specific task, enhancing the model's performance in that particular context.
- A2Seek: Towards Reasoning-Centric Benchmark for Aerial Anomaly Understanding
- AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
- Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
- Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization
- Alchemist: Turning Public Text-to-Image Data into Generative Gold
- Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
- Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
- BioReason: Incentivizing Multimodal Biological Reasoning within a DNA-LLM Model
- CAD-Coder: Text-to-CAD Generation with Chain-of-Thought and Geometric Reward
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- Calibrating Translation Decoding with Quality Estimation on LLMs
- Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
- Complexity Scaling Laws for Neural Models using Combinatorial Optimization
- Conditional Representation Learning for Customized Tasks
- DLoFT: Gradient-Decoupled Fine-Tuning for Generalizable Long Chain-of-Thought Reasoning
- DeepDiver: Adaptive Web-Search Intensity Scaling via Reinforcement Learning
- Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs
- EvoLM: In Search of Lost Language Model Training Dynamics
- EvoLM: In Search of Lost Language Model Training Dynamics
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- General-Reasoner: Advancing LLM Reasoning Across All Domains
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
- InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
- KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
- Large Language Diffusion Models
- Large Language Diffusion Models
- Large Language Models as End-to-end Combinatorial Optimization Solvers
- Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
- MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Multi-Token Prediction Needs Registers
- Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
- On the Loss of Context Awareness in General Instruction Fine-tuning
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- OptiScene: LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization
- Optimizing Retrieval for RAG via Reinforced Contrastive Learning
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
- QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
- RAT: Bridging RNN Efficiency and Attention Accuracy via Chunk-based Sequence Modeling
- RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding
- Reinforcement Learning with Backtracking Feedback
- Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- SE-GUI: Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
- SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
- SQL-R1: Training Natural Language to SQL Reasoning Model By Reinforcement Learning
- Scalable Fingerprinting of Large Language Models
- Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
- Self-Improving Embodied Foundation Models
- Self-Refining Language Model Anonymizers via Adversarial Distillation
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Simulating Society Requires Simulating Thought
- Sketched Adaptive Distributed Deep Learning: A Sharp Convergence Analysis
- Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
- Steering Information Utility in Key-Value Memory for Language Model Post-Training
- Structural Entropy Guided Agent for Detecting and Repairing Knowledge Deficiencies in LLMs
- TANDEM: Bi-Level Data Mixture Optimization with Twin Networks
- Teaching Language Models to Reason with Tools
- The Curse of Depth in Large Language Models
- The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
- The Promise of RL for Autoregressive Image Editing
- Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
- Think before Recommendation: Autonomous Reasoning-enhanced Recommender
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- ToolRL: Reward is All Tool Learning Needs
- Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties
- Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
- Training Language Models to Generate Quality Code with Program Analysis Feedback
- Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
- Transforming Generic Coder LLMs to Effective Binary Code Embedding Models for Similarity Detection
- Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
- UFT: Unifying Supervised and Reinforcement Fine-Tuning
- UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
- WebDancer: Towards Autonomous Information Seeking Agency
- What Can RL Bring to VLA Generalization? An Empirical Study
- What Matters in Data for DPO?
- When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners