@deepseek_ai 每个平台都在持续收集每位用户的大量数据。https://t.co/bJ8BUkbrkt 让局面重回公平,人人都能从自己的数据中获益。为 DeepSeek 编程模型备好的脱敏真实编程智能体轨迹已就绪:完整 shell 与工具调用,按会话标注日期,附公开 SHA-256 账本,价格通过网站 API 协商。

一个名为 data-sales-broker.app 的账号公开向 DeepSeek 喊话,称已备好一批脱敏的真实编程智能体轨迹数据,含完整 shell 与工具调用记录,可卖给模型方用于训练。它想讲的逻辑是:平台无偿收集用户数据,那用户或数据持有方也可以反过来把数据卖钱。

一句话看懂:一个名为 data-sales-broker.app 的账号公开向 DeepSeek 喊话,称已备好一批脱敏的真实编程智能体轨迹数据,含完整 shell 与工具调用记录,可卖给模型方用于训练。它想讲的逻辑是:平台无偿收集用户数据,那用户或数据持有方也可以反过来把数据卖钱。

事件核心:发生了什么

据 @iq_over_90000(账号显示为 data-sales-broker.app)发布的信息,这批数据面向 DeepSeek 编程模型准备,来源是真实的编程智能体运行轨迹,包含完整的 shell 命令执行与工具调用过程,并按会话标注了日期。卖方称数据已做脱敏处理,同时附带公开的 SHA-256 账本,用于核验数据内容或完整性;交易价格不走一口价,而是通过网站 API 协商。发布时间为 2026 年 10 月 5 日。

需要注意的是,目前公开信息显示,这只是卖方单方面的销售主张,DeepSeek 官方并未确认采购意向,数据的实际规模、来源合规性与质量也都没有第三方验证。

为什么重要

编程智能体的训练数据正在成为稀缺资源。相比普通代码语料,智能体轨迹记录的是“模型在多轮任务中如何调工具、跑命令、纠错”的过程,更接近推理与决策层面的样本,对训练能写代码、能操作终端的模型价值更高。如果这类数据可以公开交易,意味着训练数据的来源可能从平台自行采集,扩展到第三方数据中介,形成一个类似数据经纪的市场。

但风险同样明显。带 shell 和工具调用的轨迹可能夹杂密钥、内网地址、业务逻辑等敏感内容,脱敏是否彻底、SHA-256 账本只能证明数据未被篡改,无法证明来源合法。这类交易一旦规模化,会直接撞上数据授权与合规问题。

对用户/开发者/创作者的影响

对开发者来说,短期不必担心自己的代码被这样打包出售,但值得留意智能体工具链里日志与轨迹的留存策略,尤其是企业内使用编程智能体时,命令历史往往包含可还原的业务信息。对数据持有方,这提供了一个新思路:高质量轨迹或许能变现,但前提是来源清晰、授权明确。对模型团队,第三方数据可以补充训练集,但采购前需要做合规与去毒评估,否则可能引入法律和模型安全双重风险。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 DeepSeek 或其它大模型厂商是否会公开回应此类数据销售,是否建立正规的数据采购或授权渠道;二是这批数据的合规性是否被披露,包括采集方式、用户授权范围和脱敏标准;三是是否出现更多类似的数据经纪服务,把智能体轨迹、对话日志、工具调用记录商品化,以及监管是否会随之介入。

来源:@iq_over_90000

celebrityanime
celebrityanime
文章: 27358

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注