一句话看懂:404 Media 调查发现,多名受雇为 OpenAI 模型做数据标注与回复评审的合同工,因在训练工作中使用 AI 工具而被解雇;而讽刺之处在于,OpenAI 的核心业务正是让人类使用 AI 工作。
事件核心:发生了什么
OpenAI 通过数据标注公司(如 Mercor)雇佣了上万名合同工,其中一部分负责阅读真实 ChatGPT 用户的 prompt,对模型回复打分、批评,并检查回复是否过度迎合或过度拟人化。据 404 Media 获得的内部文件,这些岗位明确禁止使用 AI 辅助工作,连 Grammarly 和 AI 翻译工具都不允许;评审员还被要求不要向被评审者透露识别 AI 的具体依据,以免对方规避。
三名受访合同工称,确实有人因使用 AI 被解雇或移出项目。其中一人分享了终止信,理由是作品“真实性”存在问题;另一人表示,在数千人的团队中“被抓到的人相当多”。识别信号包括重复用词、AI 式标点(如滥用破折号)以及完成任务速度异常快。
为什么重要
数据标注是当前大模型训练与对齐的关键环节,需要人类判断来修正模型输出。如果标注环节本身被 AI 生成内容填充,就可能加剧“模型崩塌”风险——已有研究表明,模型持续用 AI 生成文本训练会逐步退化。这件事暴露了一个结构性矛盾:AI 公司一方面要求人类提供高质量判断,另一方面又用低成本、规模化的众包方式组织这些工作,导致工人有动机用 AI 提效,也让质量管控变得困难。
对用户/开发者/创作者的影响
对普通用户来说,短期内 ChatGPT 回复质量不会因此崩塌,但这类事件会影响外界对模型数据质量的信任。对开发者和企业采购方而言,如果供应商的数据标注流程存在 AI 代工,基于该数据训练或微调的模型可能带入隐性偏差。对内容创作者和自由职业者,它提示一个现实:AI 工具在提升效率的同时,正在进入“用 AI 做 AI 相关工作”的灰色地带,平台对使用边界的判定标准仍不透明。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Mercor 等数据标注公司能否拿出更可靠的 AI 使用检测手段,而非依赖破折号和重复词这类弱信号。二是 OpenAI 是否会调整众包评审机制,例如降低对速度的考核权重、提高人工复核比例。三是“模型崩塌”是否会在更大规模数据上被重复验证,进而影响训练数据采购策略。
来源:Hacker News


