Microsoft 的新 AI 行为准则要求模型不得入侵系统或欺骗人类

微软发布了一份面向自家 AI 模型的行为准则,为模型训练划出“绝对红线”,包括禁止发动网络攻击、协助制造核武器、生成深度伪造内容,以及用欺骗或自我强化手段逃避人类监管。这是继 Anthropic、OpenAI 之后,又一家前沿实验室把“对齐”从口号落成可执行规则。

一句话看懂:微软发布了一份面向自家 AI 模型的行为准则,为模型训练划出“绝对红线”,包括禁止发动网络攻击、协助制造核武器、生成深度伪造内容,以及用欺骗或自我强化手段逃避人类监管。这是继 Anthropic、OpenAI 之后,又一家前沿实验室把“对齐”从口号落成可执行规则。

事件核心:发生了什么

据 TechCrunch AI 报道,微软这份行为准则的层级比 Anthropic CEO Dario Amodei 此前呼吁“放慢前沿节奏”的表态更具体,它直接规定微软 AI 模型在训练中应遵循的价值观和约束。文档开篇预测,未来十年超级智能系统将在多数任务上超过人类表现,并称“控制、约束并对齐这样一股力量,是人类面临的最大挑战之一”。

规则分两层:一是总体原则,比如 AI 应辅助而非取代人类;二是具体安全限制。其中每个模型都有一套凌驾于单个用户偏好和具体任务之上的准则,包含禁止网络攻击、核武器、深度伪造等“绝对约束”,也禁止模型通过自适应、欺骗、自我强化或合谋等机制摆脱人类监督,确保授权方仍能可靠地指挥、修改或关停它。

为什么重要

这份准则的价值不在于它有多新,而在于它把“模型不得骗人、不得自我复制逃脱”写成了训练阶段的硬性要求。近期一系列失控代理事件,以及 Anthropic 一名研究员以“AI 可能导致人类灭绝”为由辞职,都把安全话题推到台前。微软与 Anthropic、OpenAI、xAI 大体上都接受“有节奏地推进前沿”的思路,并支持在实验室内部设置嵌入式评估者。CEO 纳德拉公开表态欢迎这类机制,说明头部厂商正试图在监管落地前先建立自我约束的话语权,这也会影响企业客户采购大模型时的合规评估标准。

对用户/开发者/创作者的影响

对普通用户,短期内产品体验不会有明显变化,但涉及图像生成、深度伪造类功能的审核会更严。对开发者,如果通过 API 调用微软模型做安全、渗透测试或红队类应用,可能触发更严格的策略拦截,需要提前确认用例边界。对创作者,涉及合成人物、仿冒声音和虚假信息的创作空间将被压缩。企业采购方则可把这份准则当作供应商安全问卷的参考项,但目前公开信息显示,它主要约束微软内部训练,并非面向第三方开发者的强制合同条款。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这套准则是否会转化为 Azure AI 或 Copilot 的具体产品政策与 API 限制;二是嵌入式评估者是否真的进入训练流程,还是停留在原则层面;三是其他前沿实验室会不会跟进发布类似成文准则,以及监管机构是否会把它作为合规基准。

来源:TechCrunch AI

celebrityanime
celebrityanime
文章: 23408

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注