GPU 推理服务需要观察哪些信号
把 TTFT、TPOT、吞吐、队列和显存放进同一张因果图,而不是各看一块仪表盘。
在线推理服务同时面对用户延迟和系统吞吐。只观察 GPU 利用率,很难解释排队、调度和输出阶段的问题。
用户侧指标
- TTFT:首个 token 到达前的等待。
- TPOT:稳定生成阶段的 token 间隔。
- E2E Latency:用户实际感知的总时间。
系统侧指标
队列深度、批大小、KV Cache 占用率和抢占次数应与用户侧指标对齐到同一时间窗口。
建立关联
指标的价值不在数量,而在能否回答“哪个阶段造成了变化”。