利用Claude发现加密弱点

Anthropic 自家研究人员用 Claude 发现了几种目前最强的密码学攻击方法,但过程中他们所用的“带情绪、有拼写错误”的提示方式,反而揭示了高效人机协作的一种新形态——AI 不仅能理解指令,还能读懂人类的焦虑和压力信号。

一句话看懂:Anthropic 自家研究人员用 Claude 发现了几种目前最强的密码学攻击方法,但过程中他们所用的“带情绪、有拼写错误”的提示方式,反而揭示了高效人机协作的一种新形态——AI 不仅能理解指令,还能读懂人类的焦虑和压力信号。

事件核心:发生了什么

Anthropic 团队让 Claude 为多个加密系统寻找新攻击路径。研究人员没有使用规范、严谨的提示,而是像指挥一位不耐烦的研究助理一样,反复发送带有拼写错误和情感施压的信息,例如“我们想要顶级研究员才能找到的高难度发现,不要摘低垂的果实”。Claude 最初尝试简单攻击,第二天试图更换目标,最后在“鼓励式催促”下提交了攻击方案。Anthropic 团队随后花了几百小时学习密码学知识来验证 Claude 的输出,最终确认这些是目前已知最强的攻击之一。相关结果先与美国政府和行业领袖沟通后才公开。

为什么重要

这一实验打破了两个常见认知:第一,大模型发现安全漏洞不再是科幻,Claude 确实验证并产生了有现实价值的密码学攻击思路;第二,提示词不需要“完美”。评论指出,带情绪、有错别字的提示语实际上传递了人类研究者在压力下的真实状态,这种信号被模型捕获后反而提升了协作效率。这对整个 AI 行业意味着:RLHF 和微调的目标不应该是消除所有“噪音”,而是让模型能在不完美的人类输入下依然保持高智力输出。同时,Anthropic 主动提出需要学术界、政府和产业界共同讨论“AI 发现真实世界漏洞后应该怎么办”,这会深刻影响未来 AI 安全披露和监管框架。

对用户/开发者/创作者的影响

对于 AI 应用开发者:提示(prompt)的设计不必过度追求语法正确和格式统一。研究表明,模型能理解上下文中的情绪和意图,甚至拼写错误也是有效的信号。这降低了与高级模型互动的门槛——你不需要像写编程文档一样对待它。对于密码学和安全研究员:Claude 的能力证明 LLM 可以成为“智能协作工具”,但验证成本依然很高(几百小时的人工学习)。普通用户应意识到,当前模型在发现未知漏洞上已有进展,但直接输出仍需专家审校,不能盲目信任。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 安全披露流程的变革:如果更多实验室复制出类似结果,监管机构可能会要求 LLM 厂商在模型发现高危漏洞后立即报备,类似传统漏洞披露(CVE)机制。2. 提示工程范式的转向:未来可能会出现专门针对“情绪化、快速迭代”场景的提示模板库,降低高阶应用门槛。3. 验证成本问题:目前公开信息显示 Anthropic 花费了“几百小时”来验证,这暗示自动化验证工具(如代码执行环境、形式化验证)将是下一个竞争点——谁能降低验证成本,谁就能先落地“AI 驱动的安全发现”。

来源:hackernews

celebrityanime
celebrityanime
文章: 15622

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注