GRAPE / INFRA
AI INFRA / SYSTEMS / FIELD NOTES

把模型性能,拆成可验证的工程信号。

聚焦 CUDA、Triton、vLLM 与 GPU 推理系统。从 Tensor Shape 到线上吞吐,用可复现的实验把复杂问题讲清楚。

红葡萄
红葡萄AI全栈技术观察者深耕算法与基础设施
红葡萄的微信二维码微信交流

扫描二维码添加微信

vLLM RUNTIMECUDA KERNELTRITON IRKV CACHETTFT / TPOTGPU MEMORYATTENTIONDISTRIBUTED INFERENCEvLLM RUNTIMECUDA KERNELTRITON IRKV CACHE
LIVE BENCHMARK LAB

性能实验,不只展示一个数字。

WAITING FOR REAL DATA
MODELQwen2.5-7BENGINEvLLMGPUA100 80GBPRECISIONBF16
TTFT
尚未接入同环境实测数据
TPOT
尚未接入同环境实测数据
THROUGHPUT
尚未接入同环境实测数据
GPU MEMORY
尚未接入同环境实测数据
红葡萄
ABOUT THE OBSERVER

技术的价值,在于把复杂问题讲清楚。

专注 AI 算法与 AI 基础设施的工程实践。记录深度学习、模型推理优化与 GPU 算力调度,也记录从实验到落地之间真正发生的问题。

查看完整经历 →
红葡萄的微信二维码微信交流

扫描二维码添加微信

正在同步搜索索引…