AI Infra 学习路线:从模型调用到系统剖析
一条以可运行项目为主线的学习路径:模型、运行时、GPU、分布式和线上服务。
AI Infra 的知识面很宽,最有效的学习方法是围绕一个可以持续测量的推理项目逐层深入。
第一阶段:跑通
理解 tokenizer、模型加载、prefill、decode 和基础服务接口。
第二阶段:测量
建立 TTFT、TPOT、吞吐、显存和并发的基线。
第三阶段:解释
进入 CUDA、Kernel、KV Cache、调度和分布式通信,解释指标为什么变化。
第四阶段:复现
每一次优化都留下环境、脚本、数据和结论边界。