long-context reasoning
- Learning to Focus: Causal Attention Distillation via Gradient‐Guided Token Pruning
- Nested Learning: The Illusion of Deep Learning Architectures
- PSMBench: A Benchmark and Dataset for Evaluating LLMs Extraction of Protocol State Machines from RFC Specifications
- Value-Guided Search for Efficient Chain-of-Thought Reasoning