Microsoft AI 为语音 Agent 推出全新转录与文本转语音模型

微软 AI 发布了流式转录模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型 MAI-Voice-2.1 系列,主打低延迟和统一音色,目标是让语音 Agent 能边听边说,并把这套能力通过 API 推向开发者。

微软 AI 发布了流式转录模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型 MAI-Voice-2.1 系列,主打低延迟和统一音色,目标是让语音 Agent 能边听边说,并把这套能力通过 API 推向开发者。

Suno 在原有 AI 音乐生成之外,上线了公开测试版的 Speech 功能,可以按脚本或提示词生成配音,并同时配上一段 AI 背景音乐。它把语音合成和音乐生成塞进同一条音轨,试图在竞争激烈的 TTS 市场之外,找到自己的差异化入口。

据 Bloomberg 报道,Anthropic 在可能接近 2 万亿美元估值的 IPO 前,邀请机构投资者当面质询公司高管,若 11 月的上市节奏成立,这将是一场体量极大的 AI 公司公开募资。

掘金作者“瞬时出道”发布了一篇面向前端的 SSE 技术长文,系统梳理了大模型流式输出从后端推送、前端分包解析到 Vue 打字机渲染的完整链路。它值得关注的地方在于:当 AI 聊天框成为产品标配,流式渲染正从“锦上添花”变成前端工程师必须掌握的底层能力。

一位开发者用 3 个 AI Agent 完成了一套报价 12 万元的 AI 客服系统,自己实际投入约 10 天、3 周交付,而同类项目传统外包通常需要 4 人团队做 2 个月。

一位 X 用户提出,大模型在云端的高昂推理成本,正把 AI 算力从"军备竞赛"推向端侧与具身场景,下一阶段比的是谁能用最低功耗解决具体问题。

CopilotKit 团队开源了 AI 智能体工作台 OpenMuse,在本地复刻 Meta Muse 的桌面助理能力,所有数据留在本机,采用 MIT 协议免费开放。它让此前受限于地区与云端数据要求的个人 Agent 体验,有了一个可自行部署的替代方案。

GitHub 上近期出现三个开源工具,让 AI Agent 能统一抓取 X、YouTube、Reddit、GitHub 等平台数据,甚至覆盖没有公开 API 的网站。这补上了 Agent 落地时最缺的一环——稳定的外部数据输入。

这个报错通常出现在把 MCP Python SDK v2 当作客户端,去调用启用了 SEP-2663 任务扩展( io.modelcontextprotocol/tasks )的服务端时:服务端在 tools/call 返回 resultType: "task" ,而当前 SDK 客户端没有内置对该

在 macOS 上跑 MCP Python SDK 测试套件时,深度嵌套请求体的用例会被判定为 INVALID_REQUEST(-32600),而测试期望 PARSE_ERROR(-32700)。核心原因通常不是 macOS 本身,而是 CPython 3.14 对深层 JSON 的解析行为发生了变