Google Vids引入Gemini Omni模型 上传自拍+音频就能定制专属数字分身

Google 在 Google Vids 中集成了多模态模型 Gemini Omni,用户仅需上传一张自拍和一段语音,即可生成外貌与声音高度相似的定制数字分身。这一功能将 Vids 从办公演示工具扩展为具有商业化潜力的视频创作平台,与 HeyGen、Synthesia 等 AI 视频公司形成直接竞争。

Google 在 Google Vids 中集成了多模态模型 Gemini Omni,用户仅需上传一张自拍和一段语音,即可生成外貌与声音高度相似的定制数字分身。这一功能将 Vids 从办公演示工具扩展为具有商业化潜力的视频创作平台,与 HeyGen、Synthesia 等 AI 视频公司形成直接竞争。

DoorDash 发布了面向开发者的 AI 命令行工具 dd-cli,允许用户通过AI助手完成从搜索商家到下单的全流程点餐操作,目前仅向美国和加拿大的 macOS 开发者开放限量测试。

AI驱动的旅行规划平台 Fora 宣布完成6000万美元D轮融资,估值突破10亿美元跻身独角兽行列。这笔由 Forerunner 和 Tactile Ventures 领投、Insight Partners 和 Thrive Capital 跟投的资金,使Fora累计融资额达到1.385亿美元。平台核心是利用…

截至2026年7月,智谱AI的年化经常性收入(ARR)已达到10亿美元规模,过去5个月内增长约15倍。这一增速源自其2025年初开始重注的AI Coding路线,使国内大模型公司在商业化上走出了一条新路。

月之暗面(Moonshot AI)于 7 月 16 日正式开源其新模型 Kimi K3,参数规模达到 2.8 万亿,并原生支持 100 万词元上下文窗口,一举成为全球最大的开源大模型。这款模型不仅在规模上超越了所有开源竞品,更在与闭源模型的参数竞赛中首次由开源方取得领先,标志着开源社区在模型体积上正式跨过了万…

1Password 于 2026 年 7 月 17 日宣布与 AI 助手 Claude 深度集成,允许 Claude 在浏览器中代为执行登录、填写验证码等任务,但所有明文密码都被隔离在 1Password 的安全保险库中,既不会被 Claude 读取,也不会上传至 Anthropic 后台。这一设计试图在 A…

Ratel 是一个开源上下文工程层,能在 Agent 每次调用时仅动态注入当前步骤所需的工具和技能,而非全量加载,从而大幅减少 token 消耗并提升模型准确性,适用于本地、开源及封面前沿模型。

Google 原计划近期发布的下一代大模型 Gemini 因关键技术指标未达到内部设定的标准而推迟上线。这一推迟不仅打乱了 Google 自身的 AI 产品路线图,也向市场传递了一个信号:即使是顶尖实验室,在通往下一代大模型的路上也面临不小的技术挑战。

2026年7月16日,欧盟委员会根据《数字市场法案》正式命令谷歌,须在12个月内让第三方AI应用在Android设备上获得与谷歌自家Gemini相同的系统功能访问权限,包括语音唤醒、跨应用操作、传感器数据调取及调用谷歌端侧AI模型等11项具体能力,否则面临法律诉讼。这一裁决将直接改变Android生态中AI应…

Netflix 透露,2026 年内其约 300 部影视作品使用了生成式 AI 技术,主要应用于后期制作环节,目标是在降低成本的同时提升输出质量与效率。这一规模化的应用实践,为影视行业如何落地 AI 提供了来自头部平台的直接参考。