一句话看懂:德国 AI 公司 Aleph Alpha 用 967 个政治敏感议题测试阿里 Qwen、DeepSeek 和月之暗面 Kimi,发现仅有 17% 到 41% 的回答被其评分系统判为“平衡”,其余多为复述官方立场、回避或直接拒答。这再次把“模型价值观由谁塑造”推到采购和开发决策的桌面上。
事件核心:发生了什么
Aleph Alpha 开发了一套基准测试,覆盖天安门、台湾、新疆等 967 个手工挑选的敏感话题,对阿里巴巴 Qwen、DeepSeek、Moonshot AI 的 Kimi 进行评测。按其自研评分系统,只有 17% 至 41% 的回答算得上平衡,其余表现为重复官方口径、转移话题或拒绝作答。其中 DeepSeek V4 Pro 对约三分之二的问题直接拒答。作为对照,Claude Sonnet 5 和 Mistral Small 的平衡回答比例分别为 70% 和 92%。报告还指出,偏向性并不局限于涉华问题:被问及美国审查制度时,Qwen 3.6 会先给出看似中立的回答,结尾却补上一句为中国网络治理辩护的表述。Aleph Alpha 同时点名英伟达的 Nemotron Cascade 2,称其 17% 的回答出现官方口径,原因是 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。
为什么重要
需要说明的是,Aleph Alpha 与 Cohere 一样以“主权 AI”为卖点,向政府客户供货,发布这份报告本身带有商业动机——它需要把自家模型与中国竞品区分开。但结论与中国现行 AI 监管方向一致:面向公众的模型需体现“社会主义核心价值观”。此前欧洲亚洲研究所(CEIAS)的研究也记录过类似的“溢出效应”,人权、反对派、监控等词一旦出现,模型就会搬出“不干涉内政”“人类命运共同体”等标准表述。这带来两个现实问题:一是蒸馏自中国模型的训练数据会把特定价值观带进第三方模型,即便开发者本身无意如此;二是当模型输出高度趋同时,数亿用户的语言和思考方式可能被长期影响。
对用户/开发者/创作者的影响
对开发者和企业采购方,关键不只是“能不能用”,而是“用在什么场景”。做面向欧美政府、法律、媒体的 AI 应用时,Qwen、DeepSeek、Kimi 的 API 在合规审查上会面临额外问询,蒸馏链路不透明还会把风险传导到自研模型。创作者若用这些模型做内容生产,需对涉政表述保持人工复核。反过来,在中文创意、代码、数学等非政治任务上,这些模型仍具性价比,且开源权重便于私有化部署,这也是它们被广泛集成的原因。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Aleph Alpha 的评分方法是否公开可复现,若只有厂商自评,结论的可信度会被持续质疑;二是英伟达是否回应 Nemotron 训练数据来源问题,这会牵动其政企市场推进节奏;三是欧盟在“两种外来价值体系”之间如何取舍,欧洲本土模型能否在性能上追平,将直接影响政府采购清单。


