NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
safety risks
3 papers
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
VLMs can Aggregate Scattered Training Patches