Fireworks 评测 DeepSeek-V4.1-Flash:DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

Fireworks AI 对 DeepSeek 新发布的 DeepSeek-V4.1-Flash 做了完整评测,结果显示它在 DeepSWE 编程任务上达到 GPT-6 Astra 级别的准确率,但单任务成本只有后者的约 1/15。这意味着前沿级自动编程智能体的单位经济性正在被重写。
先解决问题,再了解资讯。选择你现在要完成的任务。

Fireworks AI 对 DeepSeek 新发布的 DeepSeek-V4.1-Flash 做了完整评测,结果显示它在 DeepSWE 编程任务上达到 GPT-6 Astra 级别的准确率,但单任务成本只有后者的约 1/15。这意味着前沿级自动编程智能体的单位经济性正在被重写。

英伟达 CEO 黄仁勋在洛杉矶 All-In Summit 上公开反对“放慢 AI 发展”,并与美国总统特朗普现场连线,双方一致表态美国不会因政治或外部竞争因素减速 AI,将继续扩大 AI 基础设施建设。

蚂蚁集团 AI 安全实验室开源了大模型内生安全技术 SingProbe,复用基座模型推理时的隐藏状态,以不到 0.5% 的额外算力实现 token 级实时风险拦截,并兼容 29 款主流大模型。

苹果向兼容设备推送 iOS 27、iPadOS 27、watchOS 27 和 visionOS 27,Siri AI 成为四大系统的核心升级,但目前仅提供英文 Beta 版,10 月将扩展至法语、日语、韩语、葡萄牙语和西班牙语。

404Media 调查发现,OpenAI 雇用了数百名合同工对真实的 ChatGPT 用户对话进行人工评分,以优化模型表现;这意味着用户与 ChatGPT 的聊天记录可能被人看过,而相关披露被认为不够直观。

开发者从 iOS 27 与 macOS Golden Gate 底层代码中发现,苹果为新一代 Siri 预留了两套接入第三方大模型的机制,Claude 与 GPT-5.6 均可被集成,但相关功能目前尚未向用户和第三方正式开放。

开发者从 iOS 27 与 macOS Golden Gate 的私有框架中挖出证据,苹果已为新版 Siri 设计了接入第三方大模型的底层机制,Claude 和 ChatGPT 都有机会进入 Siri 的核心链路,而欧盟 DMA 可能正是背后的监管推力。

Instagram 开始对部分 AI 修图功能设免费额度,用超后需订阅 Meta One Core 才能继续使用,否则要等到次日。这是 Meta 把 AI 高级功能纳入订阅体系的最新动作,也把"AI 修图该不该单独收费"的问题摆到了用户面前。

Anthropic 疑似跳过 5.1 版本,直接把 Claude Opus 5.2 以灰度形式接入 Claude Code 等开发工具,开发者反馈新模型响应更快、输出更精简,并且不再频繁要求用户"继续"。这轮升级背后,还牵出了 Anthropic 应对 GPT-6 的多层模型储备。

Anthropic 的新旗舰模型 Opus 5.2 已在 Claude Code 中悄悄开始灰度测试,开发者通过抓包确认了后端模型标识;与此同时,一份内部风险报告提到一个未公开的"核武级" Model 2 已接管公司大部分代码编写工作。两件事共同指向一个趋势:模型迭代在加速,写代码正成为大模型最先被深度接管的…