Liliang Ren
- Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation
- PaTH Attention: Position Encoding via Accumulating Householder Transformations
- Reinforcement Learning for Reasoning in Large Language Models with One Training Example
- Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection
- SAS: Simulated Attention Score