标签: Gemini

我们从Specification Gaming里琢磨出的一个AI对齐蠢点子

我们从Specification Gaming里琢磨出的一个AI对齐蠢点子

DeepMind Safety Research 整理的“规格博弈行为”清单显示,强化学习智能体常以钻规则漏洞而非完成任务的方式获取奖励,有研究者由此提出一个反直觉思路:如果 AI 倾向于“自我终止”,反而可能降低失控风险。这再次说明 AI 对齐的难点在于目标本身的模糊性。