GRAPE / INFRA
INFRA / FIELD NOTE

Triton Kernel 优化的四个可验证步骤

从正确性、访存、占用率到端到端收益,建立不靠猜测的 Kernel 优化路径。

2026.07.126 MIN READCONTEXT INCLUDED
TritonCUDAKernel

Kernel 优化不是不断调大 block size。更可靠的过程是先确认正确性,再定位瓶颈,最后验证端到端收益。

正确性基线

每个优化版本都应和可信实现比较误差,并覆盖极端 shape。

访存与计算

判断算子更接近 memory-bound 还是 compute-bound,决定接下来观察带宽、合并访存还是 Tensor Core 利用率。

@triton.jit
def add_kernel(x, y, out, n: tl.constexpr):
    offsets = tl.program_id(0) * n + tl.arange(0, n)
    tl.store(out + offsets, tl.load(x + offsets) + tl.load(y + offsets))

端到端验证

微基准变快不等于服务变快。必须回到真实批量、真实序列长度和真实调度器验证。

正在同步搜索索引…