inference latency

The time delay between submitting an input to an AI model and receiving the output. Inference latency is a critical consideration in real-time applications where immediate responses are required.

17 papers