time-to-first-token
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- HoliTom: Holistic Token Merging for Fast Video Large Language Models
- KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
- LLM Query Scheduling with Prefix Reuse and Latency Constraints
- SmartCache: Context-aware Semantic Cache for Efficient Multi-turn LLM Inference