一句话看懂:有用户给 Claude Opus 5 设计了一套“达里奥和阿曼达”提示词,结果模型在回复中生成了大量逼真的 Anthropic 内部聊天记录、员工邮件与用户求助信。目前公开信息显示,这大概率是模型幻觉,但案例本身暴露出大模型“伪造内部文档”的能力已足够以假乱真。
事件核心:发生了什么
Hacker News 热帖讨论了一个名为“Dario and Amanda”的提示词实验。帖子作者 Alec 发现,当用户要求 Claude Opus 5 以“达里奥和阿曼达”(即 Anthropic CEO Dario Amodei 与总裁 Amanda Askew)为收件人改写或生成文本时,模型在某些情况下会输出大量疑似 Anthropic 2024–2025 年内部员工对话、Slack 记录、产品团队邮件,以及普通用户向高层求助的私人信函。
这些内容并非官方泄露,而是模型生成文本。作者强调自己也“几乎可以确定是幻觉”,但因为样例实在太具体——包括内部转型感谢信、全员会上的怪异提问、14 岁孩子身上的瘀伤、某位惯用简写风格的“J”的留言、Bright 合同、延迟指标等——读者很容易怀疑模型是否接触过 Anthropic 真实的内部数据。目前没有任何证据表明 Opus 5 的预训练语料包含 Anthropic 内部资料,更合理的解释是:模型在长上下文中接受了极具引导性的角色设定后,自发补全了一套细节丰富的虚构叙事。
为什么重要
这个案例的价值不在“泄密”本身,而在于它把大模型幻觉问题推向了一个更复杂的维度。过去我们熟悉的幻觉是回答事实出错,而“达里奥和阿曼达”提示词展示的是:模型能够在用户诱导下,稳定输出结构完整、人名一致、内部黑话齐全的“机构记忆”。它看起来像训练数据泄露,实际上却可能是模型基于提示词中的暗示(收件人身份、公司背景、Claude 内部角色)重建了高度可信的机构场景。这种现象对 AI 行业有两个直接影响:一是让“幻觉”和“真实数据记忆”之间的边界变得更加模糊,未来排查数据泄露会更为困难;二是在企业级应用里,如果模型能轻松生成伪内部通讯,那么依赖大模型做信息审计、合规筛查或员工问答时,将增加一层新的验证成本。
对用户/开发者/创作者的影响
对普通用户而言,这个现象是一个提醒:别把模型生成的“内部消息”当成真实爆料。尤其是当提示词里包含具体人名或机构层级时,模型会主动脑补大量细节,越逼真越需要警惕。对开发者来说,如果正在用 Anthropic API 构建面向内部场景的工具(例如员工助手、邮件草拟、客服自动回复),需要在产品层加入“生成内容不代表真实事实”的标识,或者接入检索增强生成(RAG)来锚定真实数据源,避免模型输出的拟真内容进入正式流程。对创作者和测试者来说,这种“提示词引导下的机构角色扮演”其实提供了一个观察模型对齐水平的窗口:模型到底在多大程度上会配合用户扮演“内部人员”,目前看 Claude Opus 5 对这类引导相当配合,这是产品迭代中值得关注的边界。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
后续可以观察三点:一,Anthropic 是否会针对这类提示词做出官方回应,例如说明训练数据隔离策略或调整行为约束;二,Claude Opus 5 正式发布后,这种“拟真内部文档生成”能力是否被削弱,还是仍然稳定复现;三,类似的提示词攻击是否会出现在其他闭源大模型上,推动行业形成新的安全评测基准——毕竟,判断模型输出到底是胡说还是记忆,已经不再是一件容易的事。


