谷歌发布 Gemini3.5Flash,原生集成计算机使用工具,替代2.5框架

谷歌将“计算机使用”工具直接原生集成进 Gemini 3.5 Flash 模型,取代了此前依赖 Gemini 2.5 的测试框架。这意味着开发者现在可以通过纯 API 调用,让 AI 像人一样“看屏幕、点鼠标、填表单”,而不必再写底层脚本。

谷歌将“计算机使用”工具直接原生集成进 Gemini 3.5 Flash 模型,取代了此前依赖 Gemini 2.5 的测试框架。这意味着开发者现在可以通过纯 API 调用,让 AI 像人一样“看屏幕、点鼠标、填表单”,而不必再写底层脚本。

谷歌 DeepMind 团队将“自主操控电脑屏幕”的能力直接集成到 Gemini 3.5 Flash 模型中,开发者从此可以用一个模型完成跨浏览器、手机和桌面的自动化操作,无需在多模型之间手动传递上下文。

谷歌在 Chrome 149 浏览器中原生集成了 Gemini 3.5 Flash 模型,并上线了“从屏幕中选择”(Select from screen)功能,用户可直接框选网页任意区域与 AI 对话,无需上传整张图片或切换工具。

腾讯在伦敦气候周期间公布了“碳寻计划”二期终选名单,从全球660多个申请中筛选出16个团队,提供约1.8亿元人民币的资助。该项目不再只是理论验证,而是要求技术在真实场景中落地,试图跨越实验室到商业应用的“死亡之谷”。

影眸科技完成数亿元新一轮融资,由开悟基金、上海国投大梁领投,现有股东跟投。这家以“00后”研发团队为主的公司,推出了全球首个支持千万级面片生成的3D大模型Rodin Gen-2.5,并已获得英伟达创始人黄仁勋在CES演讲中的公开演示采用。

用户在 Open WebUI(v0.8.12,Git Clone 安装)的聊天界面中,于 Mac 系统上使用以下操作过程触发:打开一个会话(Chat A)并输入一条消息,按下 Enter 发送后, 立即 在侧边栏中点击另一个会话(Chat B),此时 API 调用尚未完成。此操作会导致 Chat A

用户在 HuggingFace Transformers 框架下使用 Qwen3.5 模型( Qwen3_5TextModel )进行 padding-free 变长序列推理。典型场景包括:将多个样本打包成一个 batch(packing),每个样本长度不同,通过 position_ids 在每个样

胡润研究院发布的最新全球独角兽榜单显示,2026年全球独角兽企业总估值飙升43%至5.4万亿元,AI大模型公司成为估值霸主。Anthropic和OpenAI分别以6.6万亿和5.8万亿元估值占据前两位,首次将全球科技创新重心从金融科技完全拉向大模型与人工智能。

百度于6月25日宣布,文心一言将进行重大服务升级,用户需在7月25日前将历史数据迁移至百度文心网站,此后文心一言官网将停止服务,统一由百度文心网站承接所有AI功能。

机器人创业公司 RoboScience 在 6 月 24 日发布了通用具身大模型 Visics,并公开了其核心架构 VLOA(视觉-语言-物体-动作)。这意味着机器人不再只能重复单一任务的训练轨迹,而是具备了在不同硬件、不同物体和不同任务间自主执行的能力。