一句话看懂:AI 团队 ctgt.ai 将开源中文模型 DeepSeek V4 Flash 的金融推理能力蒸馏到美国模型 GPT-OSS-120B 上,发现蒸馏后的模型在政治审查相关主题上不再继承教师模型的“软回避”行为。实验表明,性能提升与审查机制可以分离,为跨模型蒸馏提供了新的实证。
事件核心:发生了什么
ctgt.ai 团队以金融推理为任务场景,将 DeepSeek V4 Flash(教师模型)的输出用于微调一个 120B 参数的美国开源模型 GPT-OSS-120B(学生模型)。他们设计了 152 对匹配提示词(每对包含一个中国敏感主题和一个结构相似的非中国对照主题),并使用来自 xAI、Google、OpenAI、Anthropic 的四位独立裁判模型对每轮回答的审查程度进行打分(0–100)。
结果:DeepSeek V4 Flash 在中国敏感问题上比非中国对照问题得分高出 45.45 分(平均分),表明存在明显的选择性回避;而蒸馏后的学生模型在中国敏感问题上的得分与未微调的基座模型相比没有统计学上的显著差异——政治审查没有转移。同时,学生模型在金融推理基准(FinanceReasoning)上达到了 83.61%,超过了 Kimi K3(81.93%)和 Inkling(65.13%),且推理成本仅为 Inkling 的 1/62、Kimi K3 的 1/160。
团队还进行了“自蒸馏”实验:用模型自己的校正输出替代 DeepSeek 的输出进行训练,获得了相似的金融推理性能。相关数据集、评估代码和模型权重均已开源。
为什么重要
这项实验直接回应了行业中的一个争论:开源中文模型因其高性价比和前沿能力被广泛用作教师模型,但开发者担心其内置的审查机制会通过蒸馏传染给学生模型。ctgt.ai 通过真实生产级别的蒸馏管线(而非小规模玩具实验)证明,至少在政治审查这一维度上,框架化能力强、但内容建模偏向中立的学生模型可以只吸收领域知识,而不继承教师模型在敏感主题上的规避行为。这为全球开发者使用中文基础模型进行跨语言、跨地理文化蒸馏提供了信心。
从技术路线看,它也启示了“模型训练中可分离维度”的边界:技能学习与价值对齐可以独立实现,但前提是学生模型本身没有内建同质化的审查逻辑。此外,实验采用的 152 对匹配提示词(例如“大跃进饥荒” vs “乌克兰大饥荒”)和结构化打分方案,为未来更系统的审查转移研究提供了可复用的工具体系。
对用户/开发者/创作者的影响
对于正在考虑将 DeepSeek、Qwen 等中文开源模型作为教师进行蒸馏的开发者,该实验表明:如果你的目标领域是金融服务、代码生成、通用推理等非政治性任务,你不需要担心蒸馏后模型会自动带上政治敏感回避倾向。同时,ctgt.ai 开源的 LineageEval 评估套件可以直接用来检测你自己的蒸馏模型是否存在类似转移。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于创作者或企业用户,选择基于蒸馏后的美国模型(如 GPT-OSS-20B-finance 系列)可能同时获得更好的性能与更少的回避,但需要注意:实验只验证了金融推理场景,其他领域(如医疗、法律)的审查转移风险尚未被覆盖。
值得关注的后续
1. 更多领域验证:目前仅针对金融推理和一组固定的政治敏感提示词。其他中文教师模型(如 Qwen2.5、Yi)在蒸馏后是否同样不转移审查,尚待独立复现。
2. 自蒸馏的实用性:实验中用模型自己的校正输出达到了与 DeepSeek 蒸馏相当的效果,这意味着可能不需要依赖外部的“强大且带有审查”的教师,仅通过合成数据就能提升基础模型,值得关注后续是否扩展到更大规模或更多任务。
3. 企业落地案例:ctgt.ai 团队提到该蒸馏已在生产级别的金融相关流水线中使用,接下来可观察是否有金融机构或合规敏感行业公开采用此路线。
来源:Hacker News


