一句话看懂:泄露信息显示,谷歌正在基于 DeepThink V3 构建代号为 Mathematica 的内部实验模型,专攻高算力消耗与复杂符号求解,目标指向谷歌最强的数学推理 AI。
事件核心:发生了什么
据 AIbase 援引泄露信息,该模型的 API 内部标识为 “models/deepthink-mathematica-tf-raw-thoughts”,支持最高 100 万词元的上下文窗口,单次输出上限为 65536 词元。上下文窗口指模型一次能处理的文本单元总量,输出上限则是单次回复可生成的文本单元数量,两项指标都远超常规对话模型的水平。
泄露配置中带有 “UNSTABLE_EXPERIMENTAL” 标签,说明这是不稳定的实验版本;同时还有 “Teamfood” 标记。这是谷歌用于内部员工测试的术语,意味着该服务目前处于内测阶段,尚未对外开放。测试平台 TestingCatalog 指出,谷歌此前已推出面向高级数学竞赛的 Gemini DeepThink IMO 模式,并于 9 月 15 日发布了 Gemini 3.8 Live 与 Live Extended Thinking。
为什么重要
数学推理长期被视作检验大模型能力上限的硬指标,它要求多步逻辑链、符号操作和可验证的推导过程,比日常问答更难用统计拟合糊弄过去。谷歌把 DeepThink 这条线专门切出一个数学版本,说明它认为通用模型的推理能力还不够,需要用针对性训练和更长上下文来啃难题。
100 万词元的上下文如果属实,意味着模型可以一次性读完长篇幅的证明、论文或题库材料,减少上下文反复截断带来的推理断点,这对数学类任务尤其关键。竞争层面,OpenAI、Anthropic 以及国内厂商都在强化推理模型,谷歌用内部代号先行试探,也是常见的信号释放方式。目前公开信息显示,该模型尚无定价、开放时间或部署形态的任何官方说明。
对用户/开发者/创作者的影响
对开发者而言,内部标识格式 “models/deepthink-mathematica-tf-raw-thoughts” 暗示它可能走与 Gemini 类似的 API 路线,”raw thoughts” 字样也让人联想到推理过程是否会被部分暴露,这直接影响调用方式和成本估算。不过实验版本通常限流严重、稳定性差,短期内不适合接入生产环境。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户,数学能力提升最直接的价值在解题、验算和公式推导,但 65536 词元的输出上限对日常使用意义有限,它更多服务于需要长篇推导的专业场景。对内容创作者,这类模型短期内更可能变成研究辅助工具,而不是内容生产主力。
值得关注的后续
一是 Mathematica 是否会脱离 Teamfood 内测、进入公开 API 或 Gemini 产品线,以及是否公布定价。二是 100 万词元上下文与 65536 输出上限在真实数学任务中的表现,能否转化为可验证的解题正确率。三是竞品是否跟进推出同类专用数学推理模型,以及谷歌此前 IMO 模式的迭代节奏是否会被这次实验版本取代。
来源:AIbase


