豆包音频生成模型1. 0 发布,开启“音频导演”时代

字节跳动旗下火山引擎于6月23日发布豆包音频生成模型1.0,用户只需输入包含角色对话、情绪、背景音乐和环境氛围的提示词,即可直接生成一段完整音频,无需手动对白、音效和配乐。这一模型同时解决了长音频中“角色声音一致性”的行业难题,将创作模式从“后期拼接”转向“一次导演”。

字节跳动旗下火山引擎于6月23日发布豆包音频生成模型1.0,用户只需输入包含角色对话、情绪、背景音乐和环境氛围的提示词,即可直接生成一段完整音频,无需手动对白、音效和配乐。这一模型同时解决了长音频中“角色声音一致性”的行业难题,将创作模式从“后期拼接”转向“一次导演”。

火山引擎今日正式发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),用户只需一句话指令即可生成包含对话、音效和背景音乐的完整音频作品,且长音频中角色声音、情感节奏能保持高度一致,极大简化传统多轨音频制作的复杂流程。

字节跳动旗下豆包于 2026 年 6 月 24 日正式推出专业版订阅服务,开启收费模式,最高连续包月 500 元。此举标志着国内用户规模最大的 AI 应用开始探索从免费向付费订阅的商业化转型,背后是模型能力已跨过“生产级质变点”的判断和巨额算力成本的现实压力。

在ISC.AI2026互联网安全大会上,中国工程院院士赵春江指出,当前AI系统面临数据层、模型层、应用层和基础层的多层安全风险,传统被动防御已失效,需主动构建AI的“免疫系统”。

Aether AI 提出“因果世界模型”技术路线,让 AI 从单纯预测“接下来发生什么”转向理解“为什么发生”并模拟干预后果,首攻 Physical AI 机器人推理层。这不仅是一次架构创新,更直接挑战了当前大模型依赖统计相关性的固有边界。

软银集团董事长孙正义在股东大会上披露,公司已在某工厂启动面向“物理AI”场景的机器人量产,并计划在2026年完成对瑞士工业巨头ABB旗下机器人业务的收购,目标成为“压倒性世界第一的机器人公司”。这一动作意味着软银正在加速从投资公司转向实体AI硬件制造商。

高通在2026年6月的汽车技术与合作峰会上,展示多款基于骁龙8775(Flex平台)的量产舱驾融合车型,并推出面向智能体时代的“车端人工智能Claw生态计划”。这意味着高通正从传统的“智能座舱芯片供应商”转向“物理AI基础计算层”的构建者,其技术能力和商业潜力需要被市场重新评估。

追觅科技澄清其汽车业务负责人离职传闻,微信开启原生AI助手“小微”小范围测试,苹果与特斯拉核心供应商塔塔电子遭遇超630GB数据泄露。三者分别反映了跨界AI硬件公司的组织调整、超级App内嵌AI助手的落地进展,以及AI供应链安全面临的现实挑战。

2026年6月23日晚,德国铁路公司(Deutsche Bahn)因全国性GSM-R数字通信系统故障,导致全境列车停运约2.5小时,大量旅客滞留车站。这次事故暴露了铁路专用通信系统的脆弱性,也对依赖交通大数据的AI调度和出行预测模型提出了现实考验。

Superhuman(即被 Grammarly 收购并更名后的公司)于 6 月 23 日宣布收购 AI 内容检测初创公司 GPTZero。这笔交易将两个专注于“AI 写作辨识”的工具整合到一起,反映了 AI 检测赛道从单一工具向平台整合的加速。