千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒

通义千问在7月20日正式发布语音合成大模型Qwen-Audio-3.0-TTS,用户不再需要调整繁琐的工程参数,直接用自然语言描述想要的语气、节奏或风格,模型就能生成相应的语音。该模型同时推出主打实时交互的Flash版(首包延迟控制在300毫秒级别)和主打高品质的Plus版,覆盖语音助手与专业配音两个方向。

通义千问在7月20日正式发布语音合成大模型Qwen-Audio-3.0-TTS,用户不再需要调整繁琐的工程参数,直接用自然语言描述想要的语气、节奏或风格,模型就能生成相应的语音。该模型同时推出主打实时交互的Flash版(首包延迟控制在300毫秒级别)和主打高品质的Plus版,覆盖语音助手与专业配音两个方向。

在 2026 年世界人工智能大会上,人形机器人公司逐际动力创始人张巍表示,其“机器人大脑”的智能水平已达到类似 GPT-3 的阶段,意味着物理世界 AI 正从概念验证进入早期落地爆发期,不再只是线性进步。

2026年7月21日,三星电子正式成立直接向CEO汇报的RX(机器人体验)事业部,整合机器人研发与商业化资源。这标志着三星将机器人从研发项目升级为独立业务单元,意图在AI+机器人赛道上追赶NVIDIA、特斯拉等竞争对手。

月之暗面于7月20日发布开源大模型 Kimi K3,登顶全球排名;马斯克随即宣称其2万亿参数模型即将完成训练并超越 Kimi。月之暗面在微博公开回应,邀请马斯克“欢迎入伙”。双方隔空交锋,将大模型参数竞赛的焦点从1.5万亿推至2万亿级别。

上海科学智能研究院于7月20日开源了多模态科学基础模型"神珍"(Monkey King Bang, MKB),用一个约110亿参数的统一模型同时处理DNA、RNA、蛋白质、小分子、气象和医学影像六类科学数据,在多项任务上达到或超过了专用模型和数值预报的水平。这一做法试图打破科学AI模型"数据各走各路、模型各自…

美国国家标准与技术研究院(NIST)下属AI标准与创新中心(CAISI)主任Chris Fall在上任仅三个月后辞职,这是该机构半年内第二位离职的负责人。此前上一任负责人Collin Burns上任不到一周即被“挤出”,背后是美国政府与Anthropic公司的持续矛盾,而CAISI本身在最新AI监管行动中被边…

阿里巴巴统一实验室(Tongyi Lab)于 2026 年 7 月 20 日发布了 Qwen-Audio-3.0-TTS,这是一个面向开发者的托管文本转语音模型,支持 16 种语言并以“Flash”和“Plus”两种层级提供。这意味着阿里在语音合成领域推出了更细分、更商业化的服务,直接对标当前市场上日益增长的…

Anthropic 为 Claude Code 发布了 v2.1.216 更新,重点修复了长会话中的严重性能退化、OAuth 令牌过期导致的自动模式中断,以及多项工作区隔离、后台代理和用户交互细节问题,并新增了沙箱文件系统禁用开关。

Adobe在其实验性iOS相机应用Project Indigo中,新增了基于大语言模型(LLM)的照片评论与编辑建议功能。该功能并非单纯的滤镜或移除工具,而是试图用AI提供类似专业摄影师的构图、光影和情绪分析,帮助用户提升拍摄技巧。

GitHub 现在允许企业管理员在计费界面直接为成本中心开启 AI 信用池,自动计算额度上限,并对超额使用进行阻止或转为按量计费。这使得 Copilot 的企业账单管理更精细、更自动化,减少了依赖 API 的手动操作。