fine-tuning
A process in transfer learning where a pre-trained model is adapted to perform a specific task with a smaller dataset, improving its performance without starting training from scratch.
- $\mathcal{X}^2$-DFD: A framework for e$\mathcal{X}$plainable and e$\mathcal{X}$tendable Deepfake Detection
- $\texttt{G1}$: Teaching LLMs to Reason on Graphs with Reinforcement Learning
- 3D-RAD: A Comprehensive 3D Radiology Med-VQA Dataset with Multi-Temporal Analysis and Diverse Diagnostic Tasks
- A geometric framework for momentum-based optimizers for low-rank training
- ATLAS: Autoformalizing Theorems through Lifting, Augmentation, and Synthesis of Data
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
- AltLoRA: Towards Better Gradient Approximation in Low-Rank Adaptation with Alternating Projections
- AnomalyCoT: A Multi-Scenario Chain-of-Thought Dataset for Multimodal Large Language Models
- Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector
- Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
- Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models
- Axial Neural Networks for Dimension-Free Foundation Models
- BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
- Backdoor Mitigation via Invertible Pruning Masks
- Beyond Token Probes: Hallucination Detection via Activation Tensors with ACT-ViT
- Bilevel ZOFO: Efficient LLM Fine-Tuning and Meta-Training
- BitMark: Watermarking Bitwise Autoregressive Image Generative Models
- Blackbox Model Provenance via Palimpsestic Membership Inference
- Brain-Informed Fine-Tuning for Improved Multilingual Understanding in Language Models
- BrainEC-LLM: Brain Effective Connectivity Estimation by Multiscale Mixing LLM
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- C-LoRA: Contextual Low-Rank Adaptation for Uncertainty Estimation in Large Language Models
- CHASM: Unveiling Covert Advertisements on Chinese Social Media
- COALA: Numerically Stable and Efficient Framework for Context-Aware Low-Rank Approximation
- CPO: Condition Preference Optimization for Controllable Image Generation
- CURE: Co-Evolving Coders and Unit Testers via Reinforcement Learning
- Can LLMs Reason Over Non-Text Modalities in a Training-Free Manner? A Case Study with In-Context Representation Learning
- Can Large Language Models Master Complex Card Games?
- Can We Infer Confidential Properties of Training Data from LLMs?
- Caption This, Reason That: VLMs Caught in the Middle
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- ChemOrch: Empowering LLMs with Chemical Intelligence via Groundbreaking Synthetic Instructions
- Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
- ConfTuner: Training Large Language Models to Express Their Confidence Verbally
- Conformal Risk Training: End-to-End Optimization of Conformal Risk Control
- Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
- Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
- CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment
- Corrector Sampling in Language Models
- DCAD-2000: A Multilingual Dataset across 2000+ Languages with Data Cleaning as Anomaly Detection
- DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- DOVE: Efficient One-Step Diffusion Model for Real-World Video Super-Resolution
- DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
- Data Efficient Adaptation in Large Language Models via Continuous Low-Rank Fine-Tuning
- Decompile-Bench: Million-Scale Binary-Source Function Pairs for Real-World Binary Decompilation
- Deep Gaussian from Motion: Exploring 3D Geometric Foundation Models for Gaussian Splatting
- Demystifying Language Model Forgetting with Low-rank Example Associations
- Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-based Decoding
- Differentially Private Federated Low Rank Adaptation Beyond Fixed-Matrix
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
- Distribution-Aware Tensor Decomposition for Compression of Convolutional Neural Networks
- Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data
- Don’t Forget the Enjoin: FocalLoRA for Instruction Hierarchical Alignment in Large Language Models
- Doubly Robust Alignment for Large Language Models
- DreamPRM: Domain-reweighted Process Reward Model for Multimodal Reasoning
- EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
- Efficient Multi-bit Quantization Network Training via Weight Bias Correction and Bit-wise Coreset Sampling
- Efficiently Maintaining the Multilingual Capacity of MCLIP in Downstream Cross-Modal Retrieval Tasks
- Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Exploring the Translation Mechanism of Large Language Models
- FALQON: Accelerating LoRA Fine-tuning with Low-Bit Floating-Point Arithmetic
- Fast MRI for All: Bridging Access Gaps by Training without Raw Data
- FedRACE: A Hierarchical and Statistical Framework for Robust Federated Learning
- Federated Continual Learning via Orchestrating Multi-Scale Expertise
- Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
- Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?
- Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation
- From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization
- From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
- GLID$^2$E: A Gradient-Free Lightweight Fine-tune Approach for Discrete Biological Sequence Design
- Gatekeeper: Improving Model Cascades Through Confidence Tuning
- Generalizable Insights for Graph Transformers in Theory and Practice
- Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers
- GeoAda: Efficiently Finetune Geometric Diffusion Models with Equivariant Adapters
- GoRA: Gradient-driven Adaptive Low Rank Adaptation
- HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs
- Harmony in Divergence: Towards Fast, Accurate, and Memory-efficient Zeroth-order LLM Fine-tuning
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- Hyperbolic Fine-Tuning for Large Language Models
- IA-GGAD: Zero-shot Generalist Graph Anomaly Detection via Invariant and Affinity Learning
- IF-Guide: Influence Function-Guided Detoxification of LLMs
- IR-OptSet: An Optimization-Sensitive Dataset for Advancing LLM-Based IR Optimizer
- Implicit Modeling for Transferability Estimation of Vision Foundation Models
- Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
- Iterative Foundation Model Fine-Tuning on Multiple Rewards
- Keeping an Eye on LLM Unlearning: The Hidden Risk and Remedy
- Knowledge Distillation of Uncertainty using Deep Latent Factor Model
- LaX: Boosting Low-Rank Training of Foundation Models via Latent Crossing
- Learning conformational ensembles of proteins based on backbone geometry
- Learning to Integrate Diffusion ODEs by Averaging the Derivatives
- Less is More: Local Intrinsic Dimensions of Contextual Language Models
- Less is More: Unlocking Specialization of Time Series Foundation Models via Structured Pruning
- LightFair: Towards an Efficient Alternative for Fair T2I Diffusion via Debiasing Pre-trained Text Encoders
- LoRA vs Full Fine-tuning: An Illusion of Equivalence
- LoRASuite: Efficient LoRA Adaptation Across Large Language Model Upgrades
- LoRATv2: Enabling Low-Cost Temporal Modeling in One-Stream Trackers
- LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning
- Localizing Knowledge in Diffusion Transformers
- MIR-Bench: Can Your LLM Recognize Complicated Patterns via Many-Shot In-Context Reasoning?
- MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling
- MONITRS: Multimodal Observations of Natural Incidents Through Remote Sensing
- Machine Unlearning via Task Simplex Arithmetic
- Mechanism Design for LLM Fine-tuning with Multiple Reward Models
- Memory-Enhanced Neural Solvers for Routing Problems
- Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
- Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
- Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
- Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
- Model Provenance Testing for Large Language Models
- Modeling the Economic Impacts of AI Openness Regulation
- Multi-Token Prediction Needs Registers
- Multitask Learning with Stochastic Interpolants
- NaDRO: Leveraging Dual-Reward Strategies for LLMs Training on Noisy Data
- NeurIPT: Foundation Model for Neural Interfaces
- Neural Attention Search
- Neural Tangent Knowledge Distillation for Optical Convolutional Networks
- Noise-Robustness Through Noise: A Framework combining Asymmetric LoRA with Poisoning MoE
- NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data
- OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
- OPMapper: Enhancing Open-Vocabulary Semantic Segmentation with Multi-Guidance Information
- OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation
- OmniTry: Virtual Try-On Anything without Masks
- On Minimax Estimation of Parameters in Softmax-Contaminated Mixture of Experts
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- One Prompt Fits All: Universal Graph Adaptation for Pretrained Models
- Optimization Inspired Few-Shot Adaptation for Large Language Models
- Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
- PANGEA: Projection-Based Augmentation with Non-Relevant General Data for Enhanced Domain Adaptation in LLMs
- PHANTOM: A Benchmark for Hallucination Detection in Financial Long-Context QA
- PLMTrajRec: A Scalable and Generalizable Trajectory Recovery Method with Pre-trained Language Models
- PROFIT: A Specialized Optimizer for Deep Fine Tuning
- PaZO: Preconditioned Accelerated Zeroth-Order Optimization for Fine-Tuning LLMs
- Path Gradients after Flow Matching
- PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation
- Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
- Private Zeroth-Order Optimization with Public Data
- Q3R: Quadratic Reweighted Rank Regularizer for Effective Low-Rank Training
- QCircuitBench: A Large-Scale Dataset for Benchmarking Quantum Algorithm Design
- QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- Quantifying Elicitation of Latent Capabilities in Language Models
- Randomized-MLP Regularization Improves Domain Adaptation and Interpretability in DINOv2
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models
- Refusal Direction is Universal Across Safety-Aligned Languages
- Repurposing AlphaFold3-like Protein Folding Models for Antibody Sequence and Structure Co-design
- Risk-aware Direct Preference Optimization under Nested Risk Measure
- RoFt-Mol: Benchmarking Robust Fine-tuning with Molecular Graph Foundation Models
- RoMa: A Robust Model Watermarking Scheme for Protecting IP in Diffusion Models
- RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
- Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition
- S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models
- SPRO: Improving Image Generation via Self-Play
- Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
- Scalable In-context Ranking with Generative Models
- SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
- Sheetpedia: A 300K-Spreadsheet Corpus for Spreadsheet Intelligence and LLM Fine-Tuning
- ShiQ: Bringing back Bellman to LLMs
- Small Singular Values Matter: A Random Matrix Analysis of Transformer Models
- SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization
- Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
- SpatialLM: Training Large Language Models for Structured Indoor Modeling
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- Spend Wisely: Maximizing Post-Training Gains in Iterative Synthetic Data Bootstrapping
- Steering When Necessary: Flexible Steering Large Language Models with Backtracking
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
- Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models
- TaiwanVQA: Benchmarking and Enhancing Cultural Understanding in Vision-Language Models
- Tapered Off-Policy REINFORCE - Stable and efficient reinforcement learning for large language models
- Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
- Towards General Continuous Memory for Vision-Language Models
- Towards Predicting Any Human Trajectory In Context
- Towards Robust Parameter-Efficient Fine-Tuning for Federated Learning
- Towards the Resistance of Neural Network Fingerprinting to Fine-tuning
- Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
- TransMLA: Migrating GQA Models to MLA with Full DeepSeek Compatibility and Speedup
- Treasure Hunt: Real-time Targeting of the Long Tail using Training-Time Markers
- Trust Region Constrained Measure Transport in Path Space for Stochastic Optimal Control and Inference
- Truthful Aggregation of LLMs with an Application to Online Advertising
- UMA: A Family of Universal Models for Atoms
- Unlearning-Aware Minimization
- Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains
- Variational Task Vector Composition
- VeriThinker: Learning to Verify Makes Reasoning Model Efficient
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models
- Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
- ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding