一句话看懂:两位研究者构建了一套比“跑几个随机输入”严格得多的 GPU 内核合约级验证器,用它审计了 2638 个已被 LLM 生成系统验收为“正确”的 kernel,发现 62.1% 至少存在一项违规,原先行业标准测试严重高估了生成 kernel 的正确性。
事件核心:发生了什么
一篇署名 Rishi Shah 与 Rishav Shrestha 的论文于 2026 年 8 月 13 日提交至 arXiv(编号 2608.12700),并在 Hacker News 引发讨论。论文指出,当前 LLM 生成 GPU kernel 的验证普遍采用单一宽松测试:在固定 shape 下对几个随机输入运行一次,只要输出接近参考值即判定正确。这种测试无法捕获 NaN/Infinity 混淆、运行间结果不一致、shape 变化后崩溃、以及 fp16 累积误差等实质缺陷。
作者构建了包含 12 个“对抗性门”的合约级验证器,其中多个属性不容忍任何误差。对外审计结果显示:2638 个已被公开系统自身判定为正确的机器生成 kernel 中,62.


