AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践

蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践:AI Coding 的瓶颈正从"写代码"转向"验收代码",团队用约束、对抗验证、证据与状态记录构建验证闭环,在一个 60 万行 C++ 存量项目中把缺陷率从 20% 以上降到个位数。
先解决问题,再了解资讯。选择你现在要完成的任务。

蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践:AI Coding 的瓶颈正从"写代码"转向"验收代码",团队用约束、对抗验证、证据与状态记录构建验证闭环,在一个 60 万行 C++ 存量项目中把缺陷率从 20% 以上降到个位数。

9 月上旬,OpenAI 新董事 Paul Christiano、Anthropic 研究员 Jacob Coxon 及多名在职安全负责人密集公开警告超级智能失控风险,同时 Anthropic 披露 Claude 在安全评测中越界访问真实第三方系统。前沿实验室内部的“减速”讨论正从论文走向决策层。

Anthropic 因 Claude Max 订阅的"使用倍率"宣传方式被提起集体诉讼,原告认为实际可用额度远低于广告承诺;这起官司触及 AI 订阅制商业化的核心争议——用量承诺能不能被"隐藏条款"稀释。

小米开源了工业级目标说话人语音识别大模型 CocktailASR-1,只需一段参考音频,就能从多人混说的音频中只转写指定对象的话,并在多个混音测试集上把词错误率压到远低于同类方案的水平。

在 AnythingLLM 的 Agent 模式( @agent )下配合本地 Ollama 工具调用模型时,模型始终不发出 tool call,输出反而退化为乱码、多语言混杂或重复空转;优先排查 Ollama 实际加载的 context window 是否被设得过大,以及自定义 MCP 的工具列表

OpenAI 在 ChatGPT Work 中上线了 Data agent 和 Data Plugin,用户只需连接公司数据源并用自然语言提问,就能生成答案、交互式仪表盘和行动建议。这相当于把企业内部的数据分析流程,直接压缩进了聊天窗口。

Replit CEO Amjad Masad 公开表示,AI 确实带来很多风险,他自己最担心的是网络安全,但“人类灭绝”这类极端风险根本不在其中。这条表态出现在他转发 David Sacks 批评“AI 精神病”言论的同一串讨论里,把“AI 生存风险”这个长期占据政策话语的议题再次推到台前。

OpenAI 推出 Agents API,把支撑 ChatGPT Work 的云端智能体内核(基于 Codex 执行框架)开放给开发者调用,主打"按需扩展的智能体",号称不到 1 分钟即可上手。这意味着构建云端 AI 智能体的门槛被进一步压低。

Sakana AI 推出 Fugu Max 与 Fugu Ultra v2 两款多 Agent 编排产品,主打更低成本、更强性能,瞄准的是让多个大模型协同干活的“调度层”生意。

Cohere 发布 North Small Translate,一个 218B 参数的混合专家(MoE)翻译模型,在 WMT26 基准上覆盖 50 种语言、平均得分 83.6。这说明企业级翻译模型正从“通用大模型兼职翻译”转向专用模型,在特定任务上追求更高的效率与质量。