feature dimension
- An Improved Algorithm for Adversarial Linear Contextual Bandits via Reduction
- Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency
- Deployment Efficient Reward-Free Exploration with Linear Function Approximation
- Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options