小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源了工业级目标说话人语音识别大模型 CocktailASR-1,只需一段参考音频,就能从多人混说的音频中只转写指定对象的话,并在多个混音测试集上把词错误率压到远低于同类方案的水平。

小米开源了工业级目标说话人语音识别大模型 CocktailASR-1,只需一段参考音频,就能从多人混说的音频中只转写指定对象的话,并在多个混音测试集上把词错误率压到远低于同类方案的水平。

在 AnythingLLM 的 Agent 模式( @agent )下配合本地 Ollama 工具调用模型时,模型始终不发出 tool call,输出反而退化为乱码、多语言混杂或重复空转;优先排查 Ollama 实际加载的 context window 是否被设得过大,以及自定义 MCP 的工具列表

OpenAI 在 ChatGPT Work 中上线了 Data agent 和 Data Plugin,用户只需连接公司数据源并用自然语言提问,就能生成答案、交互式仪表盘和行动建议。这相当于把企业内部的数据分析流程,直接压缩进了聊天窗口。

Replit CEO Amjad Masad 公开表示,AI 确实带来很多风险,他自己最担心的是网络安全,但“人类灭绝”这类极端风险根本不在其中。这条表态出现在他转发 David Sacks 批评“AI 精神病”言论的同一串讨论里,把“AI 生存风险”这个长期占据政策话语的议题再次推到台前。

OpenAI 推出 Agents API,把支撑 ChatGPT Work 的云端智能体内核(基于 Codex 执行框架)开放给开发者调用,主打"按需扩展的智能体",号称不到 1 分钟即可上手。这意味着构建云端 AI 智能体的门槛被进一步压低。

Sakana AI 推出 Fugu Max 与 Fugu Ultra v2 两款多 Agent 编排产品,主打更低成本、更强性能,瞄准的是让多个大模型协同干活的“调度层”生意。

Cohere 发布 North Small Translate,一个 218B 参数的混合专家(MoE)翻译模型,在 WMT26 基准上覆盖 50 种语言、平均得分 83.6。这说明企业级翻译模型正从“通用大模型兼职翻译”转向专用模型,在特定任务上追求更高的效率与质量。

OpenAI 发布了 Agents API 公测版,让开发者能调用支撑 Codex 和 ChatGPT 的同一套云端基础设施,构建可运行数小时、执行代码并处理文件的智能体。

Anthropic 为训练 Claude 使用盗版图书而达成的 15 亿美元和解金开始发放,但作者与出版商围绕“谁该拿钱”爆发大规模争议,暴露了 AI 训练数据版权清算的现实难题。

新晋菲尔兹奖得主、加拿大数学家 Jacob Tsimerman 宣布成立数学 AI 安全研究所(MAISI),试图像密码学家证明加密不可破解那样,用数学证明的方式论证 AI 系统是安全的。这背后是 AI 安全至今缺乏严格定义和可验证标准的现实困境。