打破多模型切换壁垒!谷歌将“电脑操作”原生塞进 Gemini 3.5 Flash

谷歌 DeepMind 团队将“自主操控电脑屏幕”的能力直接集成到 Gemini 3.5 Flash 模型中,开发者从此可以用一个模型完成跨浏览器、手机和桌面的自动化操作,无需在多模型之间手动传递上下文。

谷歌 DeepMind 团队将“自主操控电脑屏幕”的能力直接集成到 Gemini 3.5 Flash 模型中,开发者从此可以用一个模型完成跨浏览器、手机和桌面的自动化操作,无需在多模型之间手动传递上下文。

谷歌在 Chrome 149 浏览器中原生集成了 Gemini 3.5 Flash 模型,并上线了“从屏幕中选择”(Select from screen)功能,用户可直接框选网页任意区域与 AI 对话,无需上传整张图片或切换工具。

腾讯在伦敦气候周期间公布了“碳寻计划”二期终选名单,从全球660多个申请中筛选出16个团队,提供约1.8亿元人民币的资助。该项目不再只是理论验证,而是要求技术在真实场景中落地,试图跨越实验室到商业应用的“死亡之谷”。

影眸科技完成数亿元新一轮融资,由开悟基金、上海国投大梁领投,现有股东跟投。这家以“00后”研发团队为主的公司,推出了全球首个支持千万级面片生成的3D大模型Rodin Gen-2.5,并已获得英伟达创始人黄仁勋在CES演讲中的公开演示采用。

百度于6月25日宣布,文心一言将进行重大服务升级,用户需在7月25日前将历史数据迁移至百度文心网站,此后文心一言官网将停止服务,统一由百度文心网站承接所有AI功能。

机器人创业公司 RoboScience 在 6 月 24 日发布了通用具身大模型 Visics,并公开了其核心架构 VLOA(视觉-语言-物体-动作)。这意味着机器人不再只能重复单一任务的训练轨迹,而是具备了在不同硬件、不同物体和不同任务间自主执行的能力。

Tough Tongue AI 今天在 Product Hunt 上正式上线了其面向销售场景的“AI 队友”产品,允许中小企业主和领域专家在几分钟内创建能打电话、加入 Zoom/Meet 会议或嵌入自家应用的 AI 销售代表、教练或支持代理。这款产品不仅提供实时语音和虚拟形象,还会在每一次对话后自我进化,主动…

谷歌前 CEO 埃里克·施密特在华盛顿智库活动中公开表达对中国 AI 开源策略的不满,认为开源模式让 AI 技术“不受美国控制”。同时他承认,中国团队在受限硬件条件下仍造出了顶级模型,中美 AI 差距已从一年多缩短到不足半年。

一款名为 Clint AI 的新工具在产品猎人发布,声称能从一句文字描述自动构建完整可上线的 SaaS 应用,涵盖前端、认证、支付、数据库和第三方集成,并包含 AI 自动测试与修复功能。这意味着无代码开发与 AI 代码生成的结合正在从生成简单界面迈向生成完整、可交付的商业级软件产品。

AI 代理平台 Lindy 将全部生产流量从 Anthropic 的 Claude 切换到 DeepSeek v4,每年节省数百万美元推理成本,但迁移和评估工作量远超预期。这反映了在推理成本高企的背景下,企业正被迫在模型性能和成本之间做出艰难选择。