一句话看懂:AI 公司 Ornith 发布新一代开源模型 Ornith-1.5,覆盖 397B、35B 和 9B 三个规模。它最大的变化是让模型自己生成训练任务、工具框架和解题过程,再通过强化学习持续自我优化,不再依赖固定的人工标注数据。
事件核心:发生了什么
根据官方公告,Ornith-1.5 将此前在 Ornith-1.0 中引入的“自我脚手架”框架扩展为更完整的自我改进闭环:模型自行提出新任务、生成针对任务的工具与指令框架(scaffold)、产出用于强化学习的解题轨迹,从而不断创造新的学习样本。整个训练循环分为任务提议、框架生成、策略输出三个阶段,并用任务有效性、前沿难度和 novelty 三个信号来定义任务奖励。
模型阵容方面,Ornith-1.5 提供 397B MoE、35B MoE 和 9B dense 三个版本。其中旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,与 Claude Opus 4.8(85.0 和 59.0)基本持平,并超过 GLM-5.2(82.7 和 46.2)与 DeepSeek-V4-Flash-0731(82.7 和 54.4)。9B 版提供了面向手机端部署的量化版本,据称可在 iPhone 和 Android 设备上运行,性能超过 Gemma 4-31B 和 Qwen 3.6-35B 等更大规模的模型。
为什么重要
Ornith-1.5 的意义不在单一跑分,而在于训练范式的变化。目前主流开源模型大多依赖人工筛选的指令数据集和预设工具链,模型自身并不参与训练数据的生成。Ornith-1.5 尝试将“课程设计”也交给模型——它会根据自身已有能力提出更难的任务,并更新解题策略,从而在训练中持续扩大能力边界。这种自动生成任务和脚手架的做法,如果被验证有效,可能降低大模型训练中对高质量人工数据的依赖,也会让强化学习的信号来源更加多样化,而不再单纯依赖固定 benchmark 的奖励。
此外,9B 小模型在边缘设备上的表现也值得注意。如果它能以较小参数量逼近更大的稠密模型,那意味着未来端侧推理方案在 coding 和 agentic 场景中的可用性会明显提升,这会直接影响到企业选择云端 API 还是本地部署的决策。
对用户/开发者/创作者的影响
对于开发者,Ornith-1.5 的开源属性意味着可以绕过闭源 API 的按量计费,在自有环境中部署 35B 或 9B 模型,用于代码生成、命令行工具调用、自动化测试等 agentic 场景。特别是 35B 版本每 token 仅激活 3B 参数,推理成本会比同级别稠密模型更低,适合预算有限的团队接入内部工作流。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于普通用户,9B-Mobile 版本若如官方所述能在手机端流畅运行,未来可能有更多离线 AI 助手、本地代码补全工具直接跑在个人设备上,减少对网络的依赖和隐私数据上云的风险。
对于创作者和内容从业者,此次发布没有特别强调多模态或图像视频生成能力,短期影响有限,但如果你依赖 AI 写代码、搭建自动化流程,可以关注后续的社区量化版本和实际部署体验。
值得关注的后续
目前公开信息显示,Ornith-1.5 的模型权重已经可用,但有几点值得继续观察:
第一,基准测试之外的泛化表现。官方公布的 Terminal-Bench 和 DeepSWE 数据偏向终端操作与真实代码仓库任务,它在一般性问答、数学推理和长文本理解上表现如何,需要等待第三方评测结果。
第二,自我生成任务的稳定性。自动生成课程的质量会受初始策略影响,如果起始数据不够多样,存在能力上限瓶颈的可能。这一点需要对更长时间的训练日志做分析才能判断。
第三,开源许可与商业化边界。Ornith-1.5 的三个模型是否允许商用、是否限制用于训练竞品,官方公告尚未明确。开发者在采用前需要先确认模型许可证,避免合规风险。
来源:ornith.ai


