一句话看懂:开源代码托管平台 Codeberg 通过社区投票,正式禁止项目提交大量由 LLM(如 OpenAI Codex、Claude)生成的代码,同时禁止项目代码被爬取用于训练 AI。该决定直接指向“许可证粉饰”问题和 AI 数据中心扩张带来的硬件成本外溢,是开源社区对 AI 生成代码的一次明确抵制。
事件核心:发生了什么
7月27日,社区主导的开源项目托管平台 Codeberg 发布正式公告,宣布两项新增禁令:第一,禁止将平台上的项目代码用于 LLM(大语言模型)的训练数据爬取;第二,禁止在平台托管代码整体或绝大部分由 LLM(如 OpenAI Codex、Claude 等)自动生成的项目。两项提案均通过社区投票。其中,禁止 LLM 生成项目的动议以 358 票赞成对 144 票反对的结果通过。此前,Codeberg 已率先对加密货币相关项目实施了类似禁令。
为什么重要
这一决定的直接背景是硬件成本的急剧上升。Codeberg 在公告中指出,过去几年为支撑大模型训练和推理而大规模扩建的数据中心,已将电力、网络、设备等成本大量外部化,最终转移给了平台本身。更深层的原因在于“许可证粉饰”——大量开发人员利用 LLM 生成代码然后以开源许可证发布,实际上规避了开源社区对代码原创性和许可证合规性的要求。Codeberg 认为,这种做法加速了开源社区的碎片化,并破坏了开源开发中“共同学习、协作审查”的核心机制。换句话说,这不仅是技术审查问题,更是一个组织原则和社区信任体系问题,它直接挑战了“AI 生成的代码能否被视为真正的开源贡献”这一根本性问题。
对用户/开发者/创作者的影响
对普通开发者而言,如果你曾在 Codeberg 上托管过项目,它的代码现在不能被爬取用于 LLM 训练。如果你打算提交一个新项目,则需要明确标注代码是否由大模型生成。如果代码主体来自 GPT-4、Claude 或类似的工具,Codeberg 审核团队可能会直接拒绝项目入库。这一政策可能导致部分“AI 辅助编程”社群寻找替代平台,或者迫使开发者调整自己的工作流——例如保留人类撰写代码的核心部分,仅使用 AI 完成注释或补全等辅助功能。对于 LLM 工具厂商(如 OpenAI、Anthropic)而言,除非付费获取授权,否则一个重要的开源代码源将被切断。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,Codeberg 的禁令具有社区投票授权,但执行层面还面临多个未知数:一是如何定义“大量或完全由 LLM 生成”,是否存在量化阈值;二是平台如何开源审核,是否会引入静态分析工具;三是其他开源托管平台(如 GitHub、GitLab)是否会跟进类似政策。如果 GitHub 也采取类似策略,将直接影响 Copilot 等产品的代码合法性基础。此外,还值得观察这一趋势是否会从代码扩展至文本、图像或音频等内容的开源托管平台——AI 生成内容的边界和合法性,正从社区规则层面逐步清晰。
来源:Slashdot


