​小红书大模型 IMO 满分夺金:中国 AI 首次登顶数学奥赛,第三题解法让冠军选手直呼优雅

小红书自研大模型 dots-note-3.0 在 2026 年第 67 届国际数学奥林匹克竞赛(IMO)中斩获满分 42 分,成为中国首个获 IMO 金牌认证的大模型,也是继 Google Gemini 之后全球第二个达成此成就的模型,且以满分完赛,超越了 Gemini 此前解答 6 题中 5 题的成绩。

​小红书大模型 IMO 满分夺金:中国 AI 首次登顶数学奥赛,第三题解法让冠军选手直呼优雅

一句话看懂:小红书自研大模型 dots-note-3.0 在 2026 年第 67 届国际数学奥林匹克竞赛(IMO)中斩获满分 42 分,成为中国首个获 IMO 金牌认证的大模型,也是继 Google Gemini 之后全球第二个达成此成就的模型,且以满分完赛,超越了 Gemini 此前解答 6 题中 5 题的成绩。

事件核心:发生了什么

7 月 22 日,第 67 届 IMO 成绩公布。小红书大模型 dots-note-3.0 正确解答全部 6 道题目,获得满分 42 分,成功夺金。IMO 是面向全球顶尖高中生的年度数学竞赛,题目涵盖代数、组合、几何、数论,要求参赛者提供逻辑严谨、可逐段评审的完整证明,4.5 小时内完成 3 道题,对当前大模型的推理能力构成极大挑战。本届金牌线为 29 分(较去年的 35 分下降 6 分,难度显著提升),dots-note-3.0 以超金牌线 13 分的成绩完赛。

值得关注的是,第三题的组合博弈问题,dots-note-3.0 采用归纳法而非常见的图连通性转化,捕捉到问题本质结构,设计出合适的归纳对象和命题。两位 CMO 金牌得主(李泮卓、王乾桐)评价其解法“简洁优雅、结构紧密、直击要害,但人类选手难以想到这个切入角度”。该模型在整个解题过程中采用 Agent 方式,结合自然语言与 Python 代码执行,并运用递归自我批评机制审查自身论证,实现了从理解到表达的直接闭环。

为什么重要

此次满分夺金不仅是对 dots-note-3.0 技术能力的实证,更标志着小红书在基础模型领域完成了从内容社区和推荐算法专家到通用推理能力竞争者的身份跨越。与常规公开基准测试不同,IMO 题目由专家严格保密命题,模型无法提前训练,必须依赖实时理解、探索和严谨推理——这直接检验了模型的 Agentic 推理系统稳定性与归纳能力。此前,公众对小红书的技术关注主要集中于推荐系统和内容理解,缺乏在基础模型竞赛中的权威证据;42 分的满分成绩构成了一张无需解释的实力证明。该事件也凸显了行业趋势:继 Google 之后,中国大模型已跻身 IMO 金牌水平,推理能力竞争正从“能做题”转向“做得比人还优雅”。

对用户/开发者/创作者的影响

对开发者而言,dots-note-3.0 的 Agent 架构(自然语言+代码执行+递归自我批评)为构建高可靠性推理系统提供了可参考的技术路径。对 AI 应用设计者来说,模型能直接处理自然语言问题并输出完整证明,意味着在需要严格逻辑验证的领域(如教育辅导、科研辅助、代码生成)可能产生新的产品或服务形态。对于小红书平台的创作者和社区用户,虽然 dot-note-3.0 尚未公开 API 或产品化,但此次技术展示预示着平台未来可能在数学教育、知识问答、内容生成等场景引入更高级的推理能力。不过,目前公开信息显示该模型尚未正式商用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,dots-note-3.0 是否会在近期开放 API 或集成到小红书现有产品中(如笔记编辑、知识问答),以及定价策略如何制定。第二,Google Gemini 和小红书相继在 IMO 取得突破,OpenAI、Meta、DeepSeek 等头部玩家的模型是否会在下一次 IMO 或其他高难度推理基准测试中回应竞争,这将加速推理能力的评测标准升级。第三,满分解法中归纳法的应用是否能被复现并推广到更广泛的数据科学和工程问题中,这可能影响 Agent 式推理系统的设计范式。监管层面,该技术展示属于学术竞赛类成果,当前无直接政策合规风险。

来源:AIbase

celebrityanime
celebrityanime
文章: 14596

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注