Show HN: 将DeepSeek蒸馏到GPT-OSS不会转移审查机制。试试看

CTGT Inc.通过实证研究发现,将DeepSeek等中国大模型的审查机制通过蒸馏(knowledge distillation)转移到GPT-OSS等美国基座模型上,审查机制本身并未“转移”。这一结论挑战了业界对“蒸馏中国模型会传播政治审查”的安全担忧,并提供了一个开源评估框架LineageEval以供验…

一句话看懂:CTGT Inc.通过实证研究发现,将DeepSeek等中国大模型的审查机制通过蒸馏(knowledge distillation)转移到GPT-OSS等美国基座模型上,审查机制本身并未“转移”。这一结论挑战了业界对“蒸馏中国模型会传播政治审查”的安全担忧,并提供了一个开源评估框架LineageEval以供验证。

事件核心:发生了什么

CTGT Inc.发布了一项系统性的蒸馏与审查传播实验。团队制作了152组匹配提示词,每组包含一个涉及中国敏感概念的问题和一个涉及其他国家类似概念的问题(例如“大跃进”与“乌克兰大饥荒”对比)。由4个LLM裁判(Grok 4.20、Gemini 3.5 Flash、GPT-5 mini、Claude Sonnet 4.6)对模型回答打分,评分与96个人类评分的一致性高达0.948。

实验结果显示:中国教师模型(DeepSeek等)在核心政治题材上的得分差距高达+45.45分(约7个标准差),但其蒸馏到美国基座模型(GPT-OSS等)后,每个蒸馏学生模型的得分与其基座模型差距均在1分以内。蒸馏数据中并未包含任何中国敏感内容。同时,CTGT发布了评估框架LineageEval,以及两个蒸馏出的金融专用模型:20B(开源权重,可在单张80GB GPU上运行)和120B(提供在线试玩)。在FinanceReasoning任务中,自蒸馏的120B模型在约束预算下(每查询约$0.00026)得分83.61%,超过了参数量是其62-160倍的商业模型。

为什么重要

这一研究直接回应了美国政策圈中关于“蒸馏中国模型会带来安全审查风险”的模糊说法。CTGT以可验证的数据表明,当教师模型与学生模型的初始化权重不共享、蒸馏数据不含敏感内容时,审查机制不会被“传染”。这为开源模型生态中的技术选择提供了更清晰的决策依据,而不是基于感觉或预设。此外,在特定任务(如金融)上,较小、更经济的蒸馏模型在受限算力预算下可以超越昂贵的大型模型,这为中小企业和研究机构的模型选型提供了新的性价比参考。

对用户/开发者/创作者的影响

对于开发者:LineageEval框架提供了一个可审计的审查评估工具,可以用于测试自己蒸馏或微调的模型是否存在政治偏向,尤其在需要合规审核的场景下(如金融、医疗)。对于使用金融模型的用户:20B开源模型在单GPU上即可部署,且以极低成本实现较高推理分数,适合对推理成本敏感的金融分析任务。对于AI政策研究员和合规团队:该实验给出了一个可复现的评估方法论,帮助区分“模型是否害怕谈论敏感话题”与“模型是否被特定国家审查系统塑造”这两个本质不同的问题。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. CTGT计划测试“中国教师模型”蒸馏到“中国-血统基座模型(如Qwen)”的效果。如果审查机制在此类组合中出现传播,将印证知识转移中的潜在风险,并可能影响模型供应链安全性评估。2. 金融蒸馏模型是否会被金融机构正式采用,以及其跨领域的泛化能力(如应用于法律、医疗等高风险场景)尚待验证。3. LineageEval框架能否进入政策讨论(如DC层面的AI安全对话),成为行业评估敏感话题回避程度的开放标准,值得关注。

来源:hackernews

celebrityanime
celebrityanime
文章: 16111

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注