power-law distribution
- Hyperbolic Fine-Tuning for Large Language Models
- Luminance-Aware Statistical Quantization: Unsupervised Hierarchical Learning for Illumination Enhancement
- Scaling Laws for Gradient Descent and Sign Descent for Linear Bigram Models under Zipf’s Law
- Superposition Yields Robust Neural Scaling
- Superposition Yields Robust Neural Scaling