Gemini vs. Ray-Ban Meta 眼镜:在荷兰超市里,谁更能帮我导购?

Android Police 编辑在荷兰超市实测 Gemini 的 Guided Vision 与 Ray-Ban Meta 眼镜,发现 Gemini 能通过实时视频流持续扫描货架并主动提示目标位置,而 Meta 眼镜只能依靠单张静态照片。这标志着手机端 AI 视觉从"拍一张问一句"转向"连续观察、实时推理"…

一句话看懂:Android Police 编辑在荷兰超市实测 Gemini 的 Guided Vision 与 Ray-Ban Meta 眼镜,发现 Gemini 能通过实时视频流持续扫描货架并主动提示目标位置,而 Meta 眼镜只能依靠单张静态照片。这标志着手机端 AI 视觉从”拍一张问一句”转向”连续观察、实时推理”。

事件核心:发生了什么

2026 年 9 月,Gemini 上线了 Guided Vision 功能,允许 Gemini Live 通过手机摄像头持续观察画面并回答相关提问。Android Police 编辑 Nimrod Aldea 在阿姆斯特丹 Albert Heijn 超市做了对照测试,同一任务分别交给 Gemini 和 Ray-Ban Meta 眼镜:帮他找咖啡滤纸。Meta 眼镜拍下一张照片后回复”这里没找到”,测试结束。Gemini 则提示用户”向左缓慢平移镜头”,在扫描过程中突然指出”找到了,回到左边,在顶层货架”——位置准确。原文还提到,Gemini 此前已能通过远处单栋建筑判断出他所在的街区。

为什么重要

差别不在识别能力,而在交互范式。Meta 眼镜受限于静态拍摄,用户需要逐段问”这里有没有”,本质仍是自己扫描、AI 做单点确认;Guided Vision 则是连续视频流加实时推理,由 AI 承担扫描工作并主动打断用户。这背后是推理成本、延迟和端侧/云侧算力调度的问题:持续视频输入对模型吞吐和响应速度的要求远高于单帧图像。目前公开信息显示,这条路线尚未在 Ray-Ban Meta 上实现,意味着可穿戴设备在”实时视觉助手”这一场景上暂时落后于手机。

对用户/开发者/创作者的影响

对普通用户,找商品、读外文标牌、辨认细小印刷体这类任务的体验会明显改善,但公共场合对着手机或眼镜说话仍有社交尴尬,原文也反复提到这一点。对开发者,Guided Vision 这类连续视觉交互意味着新的应用层机会——导购、无障碍辅助、现场巡检都可能围绕实时视频流重做,但需要处理延迟、隐私和误报。对硬件厂商,眼镜形态的天然优势是解放双手,若视频流能力跟不上,差异化会被手机 AI 稀释。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Guided Vision 是否开放 API 或进入更多 Android 设备;二是 Meta 是否在下一代 Ray-Ban 眼镜中加入连续视频理解;三是持续调用摄像头带来的隐私与合规问题,尤其在欧盟市场,这可能直接影响功能上线节奏。

来源:Android Police

celebrityanime
celebrityanime
文章: 25578

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注