Tail-Optimized Caching for LLM Inference

Tianyi Peng (Columbia University) · Wenxin Zhang (Columbia University) · Yueying Li (National University of Defense Technology) · Ciamac C Moallemi (Columbia University)
caching policyconversation dynamicsconversation lengthshigh-latency conversationskv cache capacityleast recently usedllm inferencep90 tail latencyp95 tail latencypractical optimizationprompt cachingslo violationsstochastic modeltail latencytail-optimized lrutheoretical justification

Prompt caching is critical for reducing latency and cost in LLM inference