字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成

字节跳动于2026年7月20日发布了Seed Audio 1.0音频创作模型,将人声、音效和环境声统一在一个框架下建模,实现从文本到完整音频场景的端到端生成,已在火山方舟上线。这是AI音频从“单要素生成”走向“复杂场景创作”的一次关键升级。

字节跳动于2026年7月20日发布了Seed Audio 1.0音频创作模型,将人声、音效和环境声统一在一个框架下建模,实现从文本到完整音频场景的端到端生成,已在火山方舟上线。这是AI音频从“单要素生成”走向“复杂场景创作”的一次关键升级。

《数字生命卡兹克》公众号发布了一篇实用指南,详细拆解了零基础用户如何借助国产大模型和辅助开发工具,从0到1完成一个完整产品的开发、部署与上线。这篇文章在Kimi K3、Qwen 3.8 Max等国产模型能力迅速提升的背景下,为“不会写代码但想落地产品”的创作者提供了一条可复用的实操路径。

Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等机构领投。这笔资金将用于推动开放模型的本地运行和云端部署,目标是让 AI 像个人计算机一样可掌控、可定制且保护隐私。

特斯拉CEO埃隆·马斯克透露,其公司xAI正在训练一个参数规模达2万亿的大模型,预计下周完成初始训练,并声称其综合性能将超越此前版本,可能直接对标月之暗面近期开源的2.8万亿参数模型Kimi K3。

2026年7月19日,OpenBMB(面壁智能)正式开源了MiniCPM-Robot系列,包含一个1.5B参数的视觉-语言-动作(VLA)模型MiniCPM-RobotManip,以及专用的目标跟踪模型和推理框架。这使得个人开发者在真实机器人上运行操作任务成为可能,大幅降低了具身智能的入门门槛。

阿里巴巴即将发布新一代大模型千问3. 8,预览版已率先在阿里云和开发者平台Qoder上线,正式版计划近期开源。这意味着阿里在大模型领域的竞争策略进一步向开源和云服务倾斜。

7月19日,阿里巴巴正式推出Token Plan个人版,并同步开放了拥有2.4万亿参数的Qwen3.8-Max-Preview模型体验。这意味着阿里将大模型的调用从“按API调用付费”进一步推向“订阅制套餐”,同时用巨型模型拉高代码工程和专业办公场景的能力上限。

阿里云百炼于2025年7月20日灰度发布“HappyOyster1.0(快乐牡蛎)”,这是一个支持实时交互、可连续生成超3分钟视频的开放世界模型,标志着AI从“单向生成内容”向“实时模拟世界因果”的新范式转变。

谷歌正在对旗下企业级AI助手Gemini Enterprise进行界面统一和底层连接器升级,核心在于为后续智能代理功能铺路。此次调整不仅让企业版与消费版外观一致,更涉及权限架构的深层重构,直接影响AI读取企业数据和执行任务的能力。

腾讯旗下混元大模型Hy3原定两周的免费试用期结束后,因用户强烈反馈,决定将WorkBuddy和CodeBuddy产品的免费体验延长至8月5日。这一动作表明,在办公与编程这两个高频AI应用场景中,厂商正通过延长免费入口来争夺早期用户和真实业务数据。