Qwen 3.8 遵循 GPT-5.5 Pro 的推理预填充机制

一项公开实验显示,给 Qwen3.8 A95B 灌入 GPT-5.5 Pro 前 1% 的推理内容后,其答案与 GPT-5.5 Pro 的相似度从 16.79% 跳升到 34.97%,涨幅远超其他开源模型,暗示 Qwen 的训练数据可能与 GPT 系列关系更近。

一句话看懂:一项公开实验显示,给 Qwen3.8 A95B 灌入 GPT-5.5 Pro 前 1% 的推理内容后,其答案与 GPT-5.5 Pro 的相似度从 16.79% 跳升到 34.97%,涨幅远超其他开源模型,暗示 Qwen 的训练数据可能与 GPT 系列关系更近。

事件核心:发生了什么

开发者 wsxiaoys 在 GitHub Gist 上发布了“开源模型推理预填充”实验的 v1.1 版本,改用 GPT-5.5 Pro 作为“教师模型”。方法是对 45 道题(15 道 STEM、15 道非 STEM、15 道合成谜题)分别让每个目标模型生成两次答案:一次正常作答,一次在推理通道开头注入 GPT-5.5 Pro 推理过程的前 1%。可见答案仍由模型自由生成,再用 unigram、bigram、trigram 的召回率衡量目标模型开头 100 个 token 与教师答案的重合度。

结果显示:Qwen3.8 A95B 在预填充后从 16.79% 升至 34.97%,提升 18.18 个百分点,STEM 题提升达 26.99 个百分点;Kimi K3 基线重合度最高(31.11%),预填充后仅涨 4.54 个百分点;DeepSeek V4 Flash 反而下降 1.17 个百分点;Inkling 基本持平。

为什么重要

该实验的对比价值在于“换了教师”。在早前以 Opus 4.8 为教师的实验中,Qwen 几乎没有向 Opus 靠拢,这次换成 GPT-5.5 Pro 后却大幅移动,且对未公开的合成谜题同样明显。目前公开信息显示,这可能意味着 Qwen 的训练数据或蒸馏来源与 GPT-5.5 Pro 或同族模型更为接近,而非 Opus。对行业而言,这类“预填充探测”提供了一种低成本手段,去推测开源大模型的训练血统与数据来源,也再次把模型蒸馏、合成数据合规性推到台前。

对用户/开发者/创作者的影响

对开发者,这提醒选型不能只看跑分:如果下游任务与某个闭源模型高度相关,开源模型的“血缘”会影响迁移与微调效果。做 Agent、推理链或 API 封装的团队,可把“推理预填充”当作对比工具,判断某开源模型是否更容易承接特定闭源模型的推理风格。企业采购和合规团队则应关注训练数据来源争议,尤其在闭源模型条款限制蒸馏的背景下,这类探测结果可能成为谈判或风险评估的参考。对内容创作者,模型风格趋同意味着“换个模型换种思路”的效果在下降。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Qwen 官方是否回应训练数据来源与蒸馏质疑;二是其他团队能否复现该实验,尤其是合成谜题上的大幅跃升;三是闭源厂商是否会收紧 API 输出,以降低被用于推理预填充探测和蒸馏的空间。

来源:gist.github.com

celebrityanime
celebrityanime
文章: 22573

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注