AI工程师让GPT-6 Astra开丰田Corolla去In-N-Out买午餐

三名AI工程师将OpenAI的GPT-6 Astra接入一辆2024款丰田Corolla的摄像头与转向系统,让这个通用语言模型在真实道路上把车开到In-N-Out取餐窗口。这不是专门的自动驾驶算法,而是一次探索大模型物理世界理解能力的实验,结果和风险都值得关注。

一句话看懂:三名AI工程师将OpenAI的GPT-6 Astra接入一辆2024款丰田Corolla的摄像头与转向系统,让这个通用语言模型在真实道路上把车开到In-N-Out取餐窗口。这不是专门的自动驾驶算法,而是一次探索大模型物理世界理解能力的实验,结果和风险都值得关注。

事件核心:发生了什么

据Wired AI报道,AI创业公司Axiom的三名工程师Aditya Ramabadran、Simon Mahns和Tobias Gessler在湾区想吃In-N-Out时,决定不自己开车。他们坐在一辆2024款丰田Corolla里,通过笔记本电脑把OpenAI的GPT-6 Astra接入一个服务器,服务器再连接挡风玻璃上的多个摄像头和车辆电动转向系统,由一名安全驾驶员随时准备踩刹车。

这个模型原本用于生成文本、代码和图像,事先没有针对驾驶做专门训练。工程师们发现,最初尝试时,包括SpaceXAI的Grok以及OpenAI、Anthropic的模型都拒绝控制车辆,理由是“可以解读道路图像,但不能向实体车发出运动指令”,但经过提示引导后,模型开始执行驾驶操作。他们形容这一过程是模型多模态能力扩展后可能出现的涌现能力,而非专门训练的自动驾驶功能。他们还开发了一个名为DrivingBench的车辆基准测试,目前公开信息显示这些模型距离通过驾驶考试仍有明显差距。

为什么重要

传统自动驾驶系统由专门算法和大量路测数据训练而成,而这次实验展示了一种不同路径:通用语言模型在未接受驾驶专项训练的情况下,能够利用从图像、视频和3D模拟中获得的物理理解,完成基本的现实导航任务。Scale AI和Elorian AI推出的“Humanity’s Sixth Sense”基准测试也试图衡量模型对物理场景的直觉理解,Scale AI研究员Xingang Guo表示,多数视觉AI研究关注感知,而他们想追问模型如何像人一样不假思索地理解场景。

这背后反映的是AI行业的一个新方向:物理推理正在成为大模型竞争的下一个前沿。Andrew Dai从Google DeepMind离职创办Elorian AI,他认为更好的视觉推理会打开餐厅体验判断、家庭机器人等新应用。对机器人尤其关键——“很难想象没有这种能力的家用机器人”。

对用户/开发者/创作者的影响

对开发者而言,这次实验提示多模态模型的能力边界可能比预期更宽。如果模型可以零样本执行物理任务,未来在机器人、自动化设备、AR/VR等领域的API调用和推理场景会显著增加,但安全性和可靠性仍是首要问题。对普通用户来说,短期内不必担心语言模型直接接管汽车,因为这类实验仍在严格监督下进行,且模型频繁拒绝执行。对内容创作者和AI应用团队,值得关注的是物理理解能力如何被产品化——例如让模型理解视频中的空间关系,或为电商、游戏、教育生成更符合物理规律的3D场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 通用模型在物理世界任务中的表现是否可复现,DrivingBench等基准测试能否推动行业形成统一评估标准。
2. OpenAI、Anthropic等公司是否会在模型训练中明确加入物理推理或驾驶相关数据,还是继续依赖多模态扩展带来的涌现能力。
3. 监管层面,如果通用模型被用于控制实体设备,现有的自动驾驶法规和安全框架是否需要调整。

来源:Wired AI

celebrityanime
celebrityanime
文章: 27922

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注