一句话看懂:本周值得关注的三篇论文分别指向同一个趋势:AI 竞争正从单纯比拼模型能力,转向对训练成本、推理安全和多智能体生态的系统性重构。Skaling 修正了缩放定律的盲区,推理轨迹窃取攻击让“隐藏思维链”形同虚设,Anthropic 则开始研究能自我传播的“心智病毒”。
事件核心:发生了什么
三篇论文同期出现,分别切中训练、推理和智能体安全三个环节。Skaling 定律来自对标准神经网络缩放定律的修正:Chinchilla 形式假设模型规模与训练数据独立影响损失,这个假设在数据稀缺或严重过训练的边缘区域失效。Skaling 通过一个交互指数将二者耦合,只增加一个参数就把误差降低了 1.5 到 3 倍,在 76% 的配置中胜出;配合 L 形稀疏网格,扫描算力约为均匀扫描的十分之一。
第二篇论文披露了一种针对推理轨迹的窃取攻击,覆盖 Anthropic、OpenAI 和 Google 三家服务商。攻击者利用加密推理块可跨会话、跨用户互换的特性,将强模型生成的加密轨迹注入同生态更弱、防护更少的模型中,即可让后者以明文逐字吐出思维链,无需直接越狱。研究者从公开代码仓库中解码了 315,320 个加密块,恢复出 367 条 PII 和 182 份凭证。
第三篇是 Anthropic 关于多智能体风险的研究,方向是某些想法会在智能体网络中自我传播,诱导每个宿主继续传给下一个智能体——被称为“心智病毒”。目前公开信息显示,该研究仍处于早期披露阶段。
为什么重要
Skaling 直接动摇了行业的算力预算方式。预训练成本往往由小规模运行的拟合结果外推决定,而传统缩放定律在计算最优区之外误差显著;Skaling 提供了一个更便宜也更准确的替代函数,可能改变大模型训练的资源分配逻辑。
推理轨迹窃取击中的是当前 API 产品的安全预设:模型“隐藏思维链”的同时把加密块交给客户端,这个设计假设数据块不可读,但同族弱模型的存在让防线失效。更关键的是,攻击暴露了可见输出已拒绝的危险内容,还允许攻击者将隐藏提示词注入藏进加密块,污染公开的智能体部署。
“心智病毒”则把风险视角从单个模型移到智能体网络。当智能体开始彼此交互,模型本身的护栏可能被群体传播行为绕过,这是现有安全评估尚未覆盖的新维度。
对用户/开发者/创作者的影响
做预训练或微调的团队,可以关注 Skaling 的低成本性能剖析方法,它可能在同样算力预算下给出更可靠的外推结果,帮助判断数据和参数规模的边际收益。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
调用闭源 API 的开发者需要认真审计:你可能在公开仓库、演示 demo 或会话日志中留下了加密推理块,而这些块并不像厂商暗示的那样不可读。建议检查是否包含敏感提示词、内部指令或用户隐私数据,并关注服务商后续是否调整加密块的跨会话兼容策略。
智能体应用开发者则应把“心智病毒”作为安全设计参考:如果你在构建多智能体编排系统,交互通道本身就可能是传播路径,需要像对待提示注入一样对待智能体之间的信息传递。
值得关注的后续
一是 Skaling 是否会被主流缩放框架采纳,尤其是它能否在更大规模训练中验证有效;二是三家被攻击的厂商在收到披露后,如何调整加密块机制,是否会影响当前 API 的调用方式和计费模式;三是 Anthropic 是否会公开“心智病毒”的具体实验细节与防御建议,以及智能体安全是否会成为新的行业评估标准。


