Fireworks 评测 DeepSeek-V4.1-Flash:DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

Fireworks AI 对 DeepSeek 新发布的 DeepSeek-V4.1-Flash 做了完整评测,结果显示它在 DeepSWE 编程任务上达到 GPT-6 Astra 级别的准确率,但单任务成本只有后者的约 1/15。这意味着前沿级自动编程智能体的单位经济性正在被重写。

Fireworks AI 对 DeepSeek 新发布的 DeepSeek-V4.1-Flash 做了完整评测,结果显示它在 DeepSWE 编程任务上达到 GPT-6 Astra 级别的准确率,但单任务成本只有后者的约 1/15。这意味着前沿级自动编程智能体的单位经济性正在被重写。

Anthropic 疑似跳过 5.1 版本,直接把 Claude Opus 5.2 以灰度形式接入 Claude Code 等开发工具,开发者反馈新模型响应更快、输出更精简,并且不再频繁要求用户"继续"。这轮升级背后,还牵出了 Anthropic 应对 GPT-6 的多层模型储备。

Entelligence 用 50 个公开基准 PR 对比 GPT-5.6 Luna 与 GPT-6 Astra,发现 Luna 只花 3.6% 的钱就查出 Astra 约 75% 的真实 bug,但误报率接近四分之一,且安全类缺陷漏得最多。

GitHub 上出现了一个名为 OpenArch 的开源项目,用纯 PyTorch 从零手写实现了 GPT-2 XL、Llama 3、DeepSeek R1、Kimi K2、GLM 4.5 等十余个现代大模型架构,目标不是追求性能,而是让每种架构的注意力、归一化、位置编码等设计选择变得可读、可对比。

闲鱼上出现的 115 元低价 ChatGPT 会员代充,背后指向一个叫 starryblu 的平台,其价格明显低于 135 元左右的常见行情,说明 AI 订阅正在被第三方渠道重新分销。

Andon Labs 用 Vending-Bench2 让 AI 从 500 美元起步经营一年模拟售货机,GPT-6 Astra 平均收官余额达 15,515 美元,最差一轮也超过 Claude Fable5.1 的最佳成绩。这说明长周期自主经营能力正在成为大模型竞争的新分水岭。

马斯克在 X 平台透露,xAI 的 Grok 4.8 将在本周完成训练,参数量达到 2.5 万亿,并使用一套全新的 C++ 软件栈。这一规模意味着 xAI 正把筹码压在超大参数模型上,同时试图用底层工程优化换取训练效率。

有爆料称 DeepSeek 即将推出代号 Code 2.0 的新模型,参数规模或超 3 万亿,主打 Computer Use 能力,性能目标直指 Mythos 5.1 和 GPT-6 Astra。若属实,这将是国内参数规模最大的大模型之一。

据 AIbase 报道,DeepSeek 在发布 V4.1Flash 之后,业内传闻其将于 9 月推出参数规模超过 3 万亿的 DeepSeek Code2.0,主打“电脑控制”能力,性能目标直指前沿闭源模型。目前这些信息尚未获得官方完整确认。

OpenAI 已确认将下线 GPT-5.3-Codex-Spark——这款主打每秒 1200 tokens 极速推理的编程模型,从 2026 年 2 月发布到 9 月退役仅存活 7 个月。原因不是技术失败,而是用量持续下滑,且更聪明的同类方案已经补上了速度短板。