Triton Kernel 优化的四个可验证步骤
从正确性、访存、占用率到端到端收益,建立不靠猜测的 Kernel 优化路径。
Kernel 优化不是不断调大 block size。更可靠的过程是先确认正确性,再定位瓶颈,最后验证端到端收益。
正确性基线
每个优化版本都应和可信实现比较误差,并覆盖极端 shape。
访存与计算
判断算子更接近 memory-bound 还是 compute-bound,决定接下来观察带宽、合并访存还是 Tensor Core 利用率。
@triton.jit
def add_kernel(x, y, out, n: tl.constexpr):
offsets = tl.program_id(0) * n + tl.arange(0, n)
tl.store(out + offsets, tl.load(x + offsets) + tl.load(y + offsets))端到端验证
微基准变快不等于服务变快。必须回到真实批量、真实序列长度和真实调度器验证。