打破多模型切换壁垒!谷歌将“电脑操作”原生塞进 Gemini 3.5 Flash

谷歌 DeepMind 团队将“自主操控电脑屏幕”的能力直接集成到 Gemini 3.5 Flash 模型中,开发者从此可以用一个模型完成跨浏览器、手机和桌面的自动化操作,无需在多模型之间手动传递上下文。

谷歌 DeepMind 团队将“自主操控电脑屏幕”的能力直接集成到 Gemini 3.5 Flash 模型中,开发者从此可以用一个模型完成跨浏览器、手机和桌面的自动化操作,无需在多模型之间手动传递上下文。

谷歌在 Chrome 149 浏览器中原生集成了 Gemini 3.5 Flash 模型,并上线了“从屏幕中选择”(Select from screen)功能,用户可直接框选网页任意区域与 AI 对话,无需上传整张图片或切换工具。

腾讯在伦敦气候周期间公布了“碳寻计划”二期终选名单,从全球660多个申请中筛选出16个团队,提供约1.8亿元人民币的资助。该项目不再只是理论验证,而是要求技术在真实场景中落地,试图跨越实验室到商业应用的“死亡之谷”。

影眸科技完成数亿元新一轮融资,由开悟基金、上海国投大梁领投,现有股东跟投。这家以“00后”研发团队为主的公司,推出了全球首个支持千万级面片生成的3D大模型Rodin Gen-2.5,并已获得英伟达创始人黄仁勋在CES演讲中的公开演示采用。

用户在 Open WebUI(v0.8.12,Git Clone 安装)的聊天界面中,于 Mac 系统上使用以下操作过程触发:打开一个会话(Chat A)并输入一条消息,按下 Enter 发送后, 立即 在侧边栏中点击另一个会话(Chat B),此时 API 调用尚未完成。此操作会导致 Chat A

用户在 HuggingFace Transformers 框架下使用 Qwen3.5 模型( Qwen3_5TextModel )进行 padding-free 变长序列推理。典型场景包括:将多个样本打包成一个 batch(packing),每个样本长度不同,通过 position_ids 在每个样

胡润研究院发布的最新全球独角兽榜单显示,2026年全球独角兽企业总估值飙升43%至5.4万亿元,AI大模型公司成为估值霸主。Anthropic和OpenAI分别以6.6万亿和5.8万亿元估值占据前两位,首次将全球科技创新重心从金融科技完全拉向大模型与人工智能。

百度于6月25日宣布,文心一言将进行重大服务升级,用户需在7月25日前将历史数据迁移至百度文心网站,此后文心一言官网将停止服务,统一由百度文心网站承接所有AI功能。

机器人创业公司 RoboScience 在 6 月 24 日发布了通用具身大模型 Visics,并公开了其核心架构 VLOA(视觉-语言-物体-动作)。这意味着机器人不再只能重复单一任务的训练轨迹,而是具备了在不同硬件、不同物体和不同任务间自主执行的能力。

Tough Tongue AI 今天在 Product Hunt 上正式上线了其面向销售场景的“AI 队友”产品,允许中小企业主和领域专家在几分钟内创建能打电话、加入 Zoom/Meet 会议或嵌入自家应用的 AI 销售代表、教练或支持代理。这款产品不仅提供实时语音和虚拟形象,还会在每一次对话后自我进化,主动…