NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
token selection
3 papers
Accurate KV Cache Eviction via Anchor Direction Projection for Efficient LLM Inference
Efficient Prompt Compression with Evaluator Heads for Long-Context Transformer Inference
Limitations of Normalization in Attention