Dan Alistarh
- Efficient Data Selection at Scale via Influence Distillation
- HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- Quartet: Native FP4 Training Can Be Optimal for Large Language Models
- Unified Scaling Laws for Compressed Representations