神秘“牛来大模型”横空出世:Ox Alpha在多项基准测试中超越主流巨头

OpenRouter 于 8 月 20 日上线了一个开发者身份不明的匿名模型 Ox Alpha,其在代码与软件工程基准测试中表现超越 Claude、GPT 等多款主流旗舰模型,并已向开发者免费开放。该事件之所以值得关注,在于它可能预示着新一轮大模型能力竞争正从“榜单刷分”转向真实软件工程任务。

一句话看懂:OpenRouter 于 8 月 20 日上线了一个开发者身份不明的匿名模型 Ox Alpha,其在代码与软件工程基准测试中表现超越 Claude、GPT 等多款主流旗舰模型,并已向开发者免费开放。该事件之所以值得关注,在于它可能预示着新一轮大模型能力竞争正从“榜单刷分”转向真实软件工程任务。

事件核心:发生了什么

AI 模型聚合平台 OpenRouter 在 8 月 20 日宣布推出一款代号为 Ox Alpha 的匿名模型。尽管开发团队未公开,该模型凭借多项技术指标引发海外技术社区热议。据平台发布的信息,Ox Alpha 定位为面向代码编写、长期 Agent 任务及真实生产环境的模型,其上下文窗口容量约为 104.8 万 tokens,最大输出长度达 13.1 万 tokens,并支持文本、图像和视频的多模态输入。预览期内,该模型向开发者免费开放调用。

同一天,开源终端编程代理 OpenCode 宣布集成该模型,并准备了高达每日 100 万亿 tokens 的调用容量。独立研究员 Ben Davis 在软件工程基准 DeepSWE 的 10 个子任务上进行了测试,结果显示 Ox Alpha 的通过率约为 80%,高于 Claude Fable 5 的 65%、GLM-5.3 和 Grok 4.6 的 62%,以及 GPT-5.6 Sol 的 52%。需要说明的是,这组数据目前仅来源于该研究员的初步测试,DeepSWE 官方榜单尚未正式收录此模型。

为什么重要

Ox Alpha 的出现对当前大模型竞争格局有两点直接意义。其一,它再次验证了软件工程场景已成为衡量模型实力的关键战场——相比传统的知识问答类测试,像 DeepSWE 这类需要模型自主理解代码库、定位问题并生成补丁的基准,更接近开发者日常的真实工作流。其二,匿名发布并免费开放的模式,暗示其背后团队可能不以品牌营销为先,而是希望通过开放 API 让开发者用实际使用量投票。如果这一模型的表现经得起更多独立复测,将直接冲击现有闭源模型在代码生成与 Agent 编排领域的定价体系。

对用户/开发者/创作者的影响

对开发者而言,最直接的影响是多了个“免费且能力强”的代码与 Agent 任务候选模型。通过 OpenRouter 或 OpenCode 即可接入,无需注册专属账号,可以用极低成本测试现有工具链的替换空间。对于依赖 API 做应用层的团队来说,Ox Alpha 超过百万 token 的上下文窗口意味着可以一次性处理更大的代码仓库或长文档,降低多轮拆分带来的推理成本。创作者群体在图像与视频理解类任务上也能借助其多模态能力做内容预处理,但该模型的生成类能力目前公开信息有限,不宜过早下结论。值得留意的是,免费通常意味着限流或后续调价,当前 100 万亿 tokens 的日容量是否能长期维持,仍需观察。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来有三个具体观察点:一是 Ox Alpha 背后的开发团队是否会主动现身,若为某家头部实验室的竞品试水,将直接改变市场预期;二是 DeepSWE 官方榜单是否收录该模型并给出更大样本的验证分数,以消除单点测试的偶然性;三是 OpenRouter 和 OpenCode 的用户增量与调用量数据——如果该模型在正式开放付费后仍保持较高采用率,说明其并非“免费引流”的一次性产品,而是有真实生产力价值的长期参与者。

来源:AIbase

celebrityanime
celebrityanime
文章: 19949

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注