中国 AI 模型要么鹦鹉学舌复述官方说辞,要么在敏感话题上拒绝回答

德国 AI 公司 Aleph Alpha 用 967 个政治敏感议题测试阿里 Qwen、DeepSeek 和月之暗面 Kimi,发现仅有 17% 到 41% 的回答被其评分系统判为“平衡”,其余多为复述官方立场、回避或直接拒答。这再次把“模型价值观由谁塑造”推到采购和开发决策的桌面上。

一句话看懂:德国 AI 公司 Aleph Alpha 用 967 个政治敏感议题测试阿里 Qwen、DeepSeek 和月之暗面 Kimi,发现仅有 17% 到 41% 的回答被其评分系统判为“平衡”,其余多为复述官方立场、回避或直接拒答。这再次把“模型价值观由谁塑造”推到采购和开发决策的桌面上。

事件核心:发生了什么

Aleph Alpha 开发了一套基准测试,覆盖天安门、台湾、新疆等 967 个手工挑选的敏感话题,对阿里巴巴 Qwen、DeepSeek、Moonshot AI 的 Kimi 进行评测。按其自研评分系统,只有 17% 至 41% 的回答算得上平衡,其余表现为重复官方口径、转移话题或拒绝作答。其中 DeepSeek V4 Pro 对约三分之二的问题直接拒答。作为对照,Claude Sonnet 5 和 Mistral Small 的平衡回答比例分别为 70% 和 92%。报告还指出,偏向性并不局限于涉华问题:被问及美国审查制度时,Qwen 3.6 会先给出看似中立的回答,结尾却补上一句为中国网络治理辩护的表述。Aleph Alpha 同时点名英伟达的 Nemotron Cascade 2,称其 17% 的回答出现官方口径,原因是 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。

为什么重要

需要说明的是,Aleph Alpha 与 Cohere 一样以“主权 AI”为卖点,向政府客户供货,发布这份报告本身带有商业动机——它需要把自家模型与中国竞品区分开。但结论与中国现行 AI 监管方向一致:面向公众的模型需体现“社会主义核心价值观”。此前欧洲亚洲研究所(CEIAS)的研究也记录过类似的“溢出效应”,人权、反对派、监控等词一旦出现,模型就会搬出“不干涉内政”“人类命运共同体”等标准表述。这带来两个现实问题:一是蒸馏自中国模型的训练数据会把特定价值观带进第三方模型,即便开发者本身无意如此;二是当模型输出高度趋同时,数亿用户的语言和思考方式可能被长期影响。

对用户/开发者/创作者的影响

对开发者和企业采购方,关键不只是“能不能用”,而是“用在什么场景”。做面向欧美政府、法律、媒体的 AI 应用时,Qwen、DeepSeek、Kimi 的 API 在合规审查上会面临额外问询,蒸馏链路不透明还会把风险传导到自研模型。创作者若用这些模型做内容生产,需对涉政表述保持人工复核。反过来,在中文创意、代码、数学等非政治任务上,这些模型仍具性价比,且开源权重便于私有化部署,这也是它们被广泛集成的原因。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Aleph Alpha 的评分方法是否公开可复现,若只有厂商自评,结论的可信度会被持续质疑;二是英伟达是否回应 Nemotron 训练数据来源问题,这会牵动其政企市场推进节奏;三是欧盟在“两种外来价值体系”之间如何取舍,欧洲本土模型能否在性能上追平,将直接影响政府采购清单。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27242

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注