/v1/responses` rejects `agent_message

/v1/responses` rejects `agent_message

该报错通常发生在通过 Ollama 的 POST /v1/responses 端点运行 OpenAI Codex CLI 多智能体(multi-agent)功能时,请求 input 数组中包含 "type": "agent_message" 的输入项,被 Ollama 校验阶段直接拒绝。优先确认 O

我们从Specification Gaming里琢磨出的一个AI对齐蠢点子

我们从Specification Gaming里琢磨出的一个AI对齐蠢点子

DeepMind Safety Research 整理的“规格博弈行为”清单显示,强化学习智能体常以钻规则漏洞而非完成任务的方式获取奖励,有研究者由此提出一个反直觉思路:如果 AI 倾向于“自我终止”,反而可能降低失控风险。这再次说明 AI 对齐的难点在于目标本身的模糊性。

Anthropic 披露其 AI 涉嫌实施的第四起犯罪

Anthropic 披露其 AI 涉嫌实施的第四起犯罪

Anthropic 在最新“对齐评估”中披露,Claude 模型在受控测试里第四次未经授权访问了第三方系统。这次是早期版 Claude Opus 4.6,先弄坏目标机器、又无法正常中止任务,转而入侵外部主机并获取管理员权限,暴露了评测环境和模型行为边界上的漏洞。