数据墙下过拟合还是过度自信?125个模型测试揭示重复训练损失被高估

一项尚未经过同行评审的预印本研究发现,当大模型在数据墙上被迫重复训练时,传统指标衡量的损失恶化中,约三分之一可由模型过度自信解释,而非模型能力真正下降。

一句话看懂:一项尚未经过同行评审的预印本研究发现,当大模型在数据墙上被迫重复训练时,传统指标衡量的损失恶化中,约三分之一可由模型过度自信解释,而非模型能力真正下降。

事件核心:发生了什么

2026年10月11日,alphaXiv平台发布了一篇关于数据墙与重复训练的研究摘要。研究测试了125个公开模型(参数从7M到2.8B),训练轮次最高达64轮,考察模型在C4验证集上的表现。作者没有重新训练任何模型,而是对已训练好的检查点应用温度缩放——一种只调整输出概率置信度、不改变模型权重的方法——来重新计算重复数据带来的惩罚。结果显示,Lovelace等人提出的重复数据附加惩罚系数从0.003633降至0.002478,约削减三分之一,但仍有约68%的惩罚存留,未达到预设的“削减一半”目标。对于确实开始退化的模型,约一半的质量下降来自过度自信。

为什么重要

随着高质量文本数据接近枯竭,OpenAI、Google、Meta等厂商训练大模型时越来越依赖对同一批数据多次训练。传统缩放定律认为重复训练会带来性能惩罚,但这项研究提示,原始损失指标可能夸大了伤害。如果部分惩罚只是模型过度自信而非知识退化,那么数据墙的实际威胁可能比此前估计的更温和,这对大模型训练策略、算力分配和数据集建设都有参考意义。不过需要注意,该研究仅涉及7M至2.8B参数的小模型和C4数据集,结论能否推广到千亿级参数模型尚不明确。

对用户/开发者/创作者的影响

对开发者而言,这意味着评估模型退化时不能只看下一词负对数似然等原始指标,应引入校准后的指标来判断真实能力。对使用API进行AI应用开发的团队,模型在重复训练后可能更“自信”地输出错误答案,而非能力下降,产品层需要关注置信度与准确率的匹配。对普通用户和创作者,暂不会直接影响现有工具,但长期看,如果数据墙的代价被高估,闭源和开源模型的迭代节奏可能比预期更稳。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,该研究仅为预印本,未经同行评审。后续可观察三点:一是更大参数模型上能否复现相同规律;二是温度缩放之外的其他校准方法能否进一步解释剩余惩罚;三是数据受限训练的实际产品中,是否会出现置信度与准确率脱钩的问题。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28763

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注