神了,有人已经开始当Codex的星怒了😂 有人真的把自己接进了 Codex 的 Agent Loop。 而且不是接机械臂,也不是接机器人。 是接了一个……会让人身体有反应的小玩具。 作者让 Codex + GPT-5.5 扮演 RPG 里的「触手怪」,iPhone 摄像头实时观察自己的姿势和反应。 模型看一眼画面,判断你现在是什么状态。 然后直接下指令: ESP32-S3 → 蓝牙设备 → 你。 你一动,摄像头又看到了。 模型再根据你…

有开发者将 Codex 接入一个可远程控制的身体设备,形成“AI 观察肢体反应—判断状态—控制设备—再观察反应”的闭环,被视为一次民间对具身智能交互的极端实验。

一句话看懂:有开发者将 Codex 接入一个可远程控制的身体设备,形成“AI 观察肢体反应—判断状态—控制设备—再观察反应”的闭环,被视为一次民间对具身智能交互的极端实验。

事件核心:发生了什么

据 X 用户 @MaxForAI 于 2026 年 8 月 23 日发布的推文,有开发者利用 OpenAI 的 Codex 与 GPT-5.5 模型,将 iPhone 摄像头对准自己,并让模型实时分析人体姿态与反应。系统通过 ESP32-S3 芯片和 BLE 协议反向控制一台原本只能用手机 App 操作的蓝牙设备,使其在模型判断后自动改变工作模式。

整个链路的关键在于“异步控制”:设备运行时,Codex 仍持续读取摄像头画面,即 AI 的“决策”与“执行”并非串行等待,而是并行发生。作者将该场景描述为“以自己身体作为环境反馈的具身 Agent”。该系统由一台 iPhone、一个 ESP32 开发板和一个大模型 API 构成,未使用机械臂或机器人本体。

为什么重要

这一实验的意义不在设备本身,而在其展示的大模型实时闭环能力。传统具身智能研究通常依赖专用传感器、运动规划算法和机械硬件,而该项目仅用通用视觉输入加语言模型推理,就完成了一个“感知—决策—控制—反馈”的完整环路,无需为特定动作训练专门模型。它说明现成的多模态大模型配合低成本硬件(如 ESP32)已能承担一定实时控制任务,这降低了具身交互原型开发的门槛。

同时,该案例也暗示 BLE 协议逆向并不复杂,消费级设备的控制接口正在成为大模型可调用的“工具”。对于开发者社区而言,这是一次将语言模型从文本输出延伸到物理动作的极简示范。

对用户/开发者/创作者的影响

对开发者而言,该实验提供了一个可复现的技术路径:用摄像头接入多模态 API,通过串口或蓝牙控制执行器,再用异步回调维持实时性。这种“视觉 + 语言模型 + 低功耗 MCU”的组合,比购买整机机器人更便宜,适合做交互原型验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户而言,目前公开信息显示该设备并非量产产品,只是个人实验,但相关思路可能启发可穿戴设备或智能家居的下一代交互方式——例如系统根据用户表情或姿势自动调节灯光、音乐或按摩强度。创作者也可以利用同类架构制作互动装置,让作品根据观察者的动作实时改变输出。

值得关注的后续

1. 该项目是否公开代码或硬件 BOM,若有开源,会推高 ESP32 + 多模态 API 的控制类项目数量。2. 大模型 API 的响应延迟是否影响闭环稳定性,若 GPT-5.5 的推理速度不足,可能需要本地小模型配合。3. 此类实验涉及身体反馈与自动控制,未来是否面临平台使用条款限制或硬件合规问题,仍需观察。

来源:@MaxForAI

celebrityanime
celebrityanime
文章: 19861

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注