使用 codex 进行自动研究:我是如何实现 232 倍更快内核的

一位开发者用 OpenAI Codex 作为“自动研究”工具,在 GPU 内核优化竞赛中把基线方案的运行速度提升了 232 倍;这件事说明大模型驱动的 Agent 已经能从试错中学习,并在底层系统优化领域取得实用成果。

一句话看懂:一位开发者用 OpenAI Codex 作为“自动研究”工具,在 GPU 内核优化竞赛中把基线方案的运行速度提升了 232 倍;这件事说明大模型驱动的 Agent 已经能从试错中学习,并在底层系统优化领域取得实用成果。

事件核心:发生了什么

GPU Mode 与 Core Automation 联合举办了一场以“自动研究”为主题的竞赛,要求参赛者实现批量方阵的紧凑 Householder QR 分解(QR factorization),即用 CUDA 或 Triton 编写高性能内核,并以 PyTorch 的 torch.geqrf 行为作为校验基准。竞赛按几何平均运行时间排名,矩阵规模覆盖 512×512 到 4096×4096。

作者 Sankalp 在 183 名参赛者中排名第 12,最终取得 232 倍于基线的加速。他在 14 天内提交了超过 1500 次结果,全程依赖 Codex 进行代码生成、测试、基准测试和迭代改进。竞赛方提供了名为 Popcorn 的命令行工具,允许 Agent 直接测试并提交,形成高频反馈循环。

为什么重要

这件事的意义不在于“AI 学会了线性代数”,而在于它验证了一种新的开发范式:大模型不仅能用自然语言生成代码,还能在反馈环中持续调整策略、走出局部最优。

值得注意的细节是,作者自称并非 GPU 优化专家,仅有一年左右的入门经验;而排在他前一位的选手是英伟达首席工程师。尽管存在经验差距,借助 Codex 的迭代能力,作者仍然达到了接近专业水平的优化结果。这暗示 LLM Agent 可能正在把“高端工程直觉”变成一个可以被系统化搜索和试错替代的过程。

此外,竞赛允许使用 FP16、FP8 甚至 NVFP4 等低精度格式做内部计算,只需最终结果通过 FP32 风格校验,这为 AI Agent 探索数值稳定性与性能的平衡提供了更大空间。

对用户/开发者/创作者的影响

对于开发者,最直接的借鉴是:如果你正在编写 GPU 内核、算法库或任何有明确基准测试的底层代码,可以用 LLM Agent 来做“循环工程”——让模型不断提交、查看性能反馈、调整策略。这不再只是“自动补全”,而是“自动研究”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于使用 AI 编程工具的普通用户,这件事说明:模型对领域的理解深浅,决定它能问出多好的问题、做出多好的判断。作者在文章中特别提到,先弄清“未知的未知”,才能向 LLM 提出更好的问题;领域基础越扎实,Agent 的上限越高。

对于创作者和技术内容生产者,这个案例也是一个很好的叙事素材:AI 并不是取代工程师,而是放大了工程师的迭代速度和试错能力。

值得关注的后续

第一,这种“Agent + 高频反馈”模式会否被更多竞赛或企业用于真实内核开发。GPU Mode 明确将这次竞赛定位为“线性代数内核研究系列”的一部分,后续如果继续举办类似活动,值得观察参赛者的 Agent 使用深度是否会进一步提高。

第二,Codex 类工具对数值计算和底层系统优化的支持是否会加强。目前 GPT 系列模型在 CUDA/Triton 上的训练数据仍然有限,232 倍速加速的取得也有大量人工干预——比如作者让模型引入“想法多样性”来跳出局部最优,这实际是一种半自动调优流程。

第三,低精度计算与容错校验结合带来性能提升的空间有多大。最近一年多家厂商都在推动 FP8 甚至更低精度的训练/推理硬件支持,此次竞赛中内部精度放松带来的性能收益值得关注,它可能影响未来内核库的设计原则和行业标准。

来源:Hacker News

celebrityanime
celebrityanime
文章: 18614

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注