Codeberg: 服务条款更新,禁止LLM滥用

代码托管平台 Codeberg 更新了服务条款,明确禁止用户利用该平台资源(包括拉取请求、代码仓库等)对大型语言模型进行训练或推理。这一举动表明,开源社区正在从协议层面主动防御大模型对其代码和数据的系统性采集。

Codeberg: 服务条款更新,禁止LLM滥用

一句话看懂:代码托管平台 Codeberg 更新了服务条款,明确禁止用户利用该平台资源(包括拉取请求、代码仓库等)对大型语言模型进行训练或推理。这一举动表明,开源社区正在从协议层面主动防御大模型对其代码和数据的系统性采集。

事件核心:发生了什么

Codeberg 在 Pull Request #1253 中提出了服务条款的修订方案,核心内容是新增了对“大规模语言模型(LLM)滥用”的限制条款。具体而言,用户不得使用 Codeberg 平台上的代码、issue、评论等内容来训练、微调或运行 LLM,也不得通过平台 API 或 Web 爬虫大量抓取数据用于此类目的。Codeberg 是一个基于 Git 的代码托管服务,类似于 GitHub 或 GitLab,但由非盈利组织运营,强调自由与开放协作。这一更新直接针对近年来 AI 公司大规模抓取开源代码数据集的行为,意在保护平台上的项目贡献者权益。

为什么重要

这对 AI 行业的数据获取模式构成了一道明确的壁垒。过去,多数代码托管平台(如 GitHub)的默认公共仓库许可允许其他用户在遵守开源许可的前提下使用代码,但并未专门禁止用于 AI 训练。Codeberg 的这项条款升级,相当于在协议层直接切断了 LLM 及其所属企业对平台内代码的“无限制摄取”。这不仅是法律声明,更是社区态度的公开表达——开源不等于无条件提供训练数据。考虑到 Codeberg 虽然用户量不及 GitHub,却是众多注重自治权的自由软件项目(如 Forgejo)的核心承载方,其决策可能会影响其他平台的政策制定,形成行业连锁反应。这意味着 AI 公司在收集代码训练数据时,将面临更多来源的不确定性,并需实质性地评估合规风险。

对用户/开发者/创作者的影响

对于普通开发者,这一条款并不会影响日常使用——正常提交代码、提 issue、发起 pull request 都是在允许范围内的。唯一需要注意的,是不要出于训练模型的明确目的去批量下载仓库内容。对于维护开源项目的贡献者,这提供了一个更明确的权益保护信号:他们的代码不会被默认为“AI训练原料”,减少了被动贡献的风险。对于 AI 公司或研究者,直接的影响是不能再以自动化方式从 Codeberg 获取数据用于 LLM 训练,如果已有模型依赖该平台数据,需要重新评估训练数据来源的合法性。创作者和内容平台管理者也可以参考这一模式,考虑是否在自己的服务条款中加入类似限制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

有几个动向值得跟进:第一,Codeberg 更新正式生效后,是否会配合技术措施(如增加反爬虫验证、限制高频 API 调用)来强化条款执行。第二,GitHub 等其他主流代码平台是否会跟进类似条款——目前 GitHub 的态度更偏向鼓励数据开放,但社区压力正在上升。第三,AI 公司在训练数据中遗漏 Codeberg 这类平台的数据后,会否导致模型在涉及自由软件、特定项目时的能力降级或偏差出现。这些观察点有助于判断整个“训练数据合规”赛道的下一步走向。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 14682

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注