vLLM RUNTIMECUDA KERNELTRITON IRKV CACHETTFT / TPOTGPU MEMORYATTENTIONDISTRIBUTED INFERENCEvLLM RUNTIMECUDA KERNELTRITON IRKV CACHE
RESEARCH TRACKS / 003
不同问题,需要不同的观察方式。
三个长期系列使用不同的信息结构,但共享同一套 Signal Grid 语言。
LIVE BENCHMARK LAB
WAITING FOR REAL DATA性能实验,不只展示一个数字。
MODELQwen2.5-7BENGINEvLLMGPUA100 80GBPRECISIONBF16
尚未接入同环境实测数据
尚未接入同环境实测数据
尚未接入同环境实测数据
尚未接入同环境实测数据
DEEP DIVE / EDITOR’S SIGNAL
01 / 07本期重点信号
FEATURED SIGNAL01
INFRA · 2026.07.18
vLLM KV Cache:从显存账本到吞吐边界
用可计算的显存账本理解 KV Cache、并发请求和最大上下文之间的约束关系。
LATEST SIGNALS / CHRONOLOGICAL
查看完整档案 →最新工程笔记
S-001INFRAS-002INFRAS-003INFRAS-004ALGORITHMS-005ALGORITHMS-006CAREER
vLLM KV Cache:从显存账本到吞吐边界
用可计算的显存账本理解 KV Cache、并发请求和最大上下文之间的约束关系。
Triton Kernel 优化的四个可验证步骤
从正确性、访存、占用率到端到端收益,建立不靠猜测的 Kernel 优化路径。
GPU 推理服务需要观察哪些信号
把 TTFT、TPOT、吞吐、队列和显存放进同一张因果图,而不是各看一块仪表盘。
从 Tensor Shape 重新理解 Attention
沿着 batch、head、sequence 和 dimension 四个轴,追踪 Attention 的计算与存储。
Top-k、Top-p 与温度:采样不是三个旋钮
从概率分布的重塑过程理解温度、候选截断和生成稳定性。
AI Infra 学习路线:从模型调用到系统剖析
一条以可运行项目为主线的学习路径:模型、运行时、GPU、分布式和线上服务。
ABOUT THE OBSERVER
技术的价值,在于把复杂问题讲清楚。
专注 AI 算法与 AI 基础设施的工程实践。记录深度学习、模型推理优化与 GPU 算力调度,也记录从实验到落地之间真正发生的问题。
查看完整经历 →