NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
targeted interventions
3 papers
Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
Deferring Concept Bottleneck Models: Learning to Defer Interventions to Inaccurate Experts
Refusal Direction is Universal Across Safety-Aligned Languages