Pulpie:用于清理网络的Pareto最优模型

Feyn Labs 于 2025 年 6 月 25 日发布 Pulpie 模型系列,以 1/20 的成本实现了与现有最佳网页内容提取器相当的精度,其最小模型在参数量仅为对手 1/3 的情况下,处理速度提升 20 倍,每处理 10 亿页的成本从 15.9 万美元降至 7,900 美元。这意味着大规模高质量网页数…

Pulpie:用于清理网络的Pareto最优模型

一句话看懂:Feyn Labs 于 2025 年 6 月 25 日发布 Pulpie 模型系列,以 1/20 的成本实现了与现有最佳网页内容提取器相当的精度,其最小模型在参数量仅为对手 1/3 的情况下,处理速度提升 20 倍,每处理 10 亿页的成本从 15.9 万美元降至 7,900 美元。这意味着大规模高质量网页数据清洗的门槛被显著降低。

事件核心:发生了什么

Feyn Labs 推出了名为 Pulpie 的开源模型家族,用于从 HTML 页面中精准提取正文内容。其最小模型“pulpie-orange-small”拥有 2.1 亿参数,在 WebMainBench 基准上取得 0.862 的 ROUGE-5 F1 分数,几乎持平当前最佳提取器 Dripper(0.864),但参数量仅为后者的 1/3。Pulpie 采用编码器架构,能通过单次前向推理为每个 HTML 块标记“内容”或“样板”标签,避免了 Dripper 解码器逐 token 推理带来的算力开销。在 NVIDIA L4 GPU 上,该模型每秒处理 13.7 页,而 Dripper 仅为 0.68 页。基于每台实例每小时 0.39 美元的成本计算,清洗 10 亿页网页,Pulpie 花费约 7,900 美元,Dripper 则高达 15.9 万美元。

为什么重要

大语言模型从预训练到推理时刻都在消耗网页数据,但典型页面中约 70% 的 HTML 块是导航、广告等无关内容。此前研究(Ma et al., 2025)已证实,改用模型提取器比启发式规则直接提升模型平均准确率 1.08 个百分点,甚至让模型性能超过精心过滤的 FineWeb 与 RefinedWeb 语料库。Pulpie 以极低成本和开源形式,将“高质量提取”从昂贵实验变成了可在万亿 token 规模上落地的技术。它将此前高精度但昂贵的“阅读型”提取器(如 Dripper)的成本结构拉低到与启发式方法接近的水平,可能彻底改变当前预训练语料构建和上下文管理的数据处理流程。

对用户/开发者/创作者的影响

  • AI 研究团队与训练管道开发者:Pulpie 开源可用(Hugging Face),意味着可以在单张 GPU 上以极高吞吐量清洗大规模抓取数据,预训练语料的纯度提升成本大幅下降。对于构建模型的新团队,这是降低基础设施预算的直接途径。
  • 上下文管理与 RAG 系统开发者:在推理时,去除广告、侧边栏等噪声能减少无关内容对模型回答的干扰。引入 Pulpie 作为预处理环节,可以将更多有效上下文塞入有限的 token 窗口,提高检索增强生成的效果。
  • 内容创作者与发布者:网页内容的质量和可复现性正受到更严格的审视。Pulpie 对代码块和公式的保真度更高(分别从 0.13 提升至 0.91,从 0.61 提升至 0.94),意味着创作者发布的技术文章或数学公式,在被模型抓取训练后更不容易被“损坏”,有利于保持学术与专业内容的完整性。

值得关注的后续

  1. 竞品的响应与模型迭代:Dripper 等现有提取器是否会调整架构(如转向编码器)或降价来应对,将影响网页数据清洗市场的新格局。
  2. 在超大规模预训练中的实际效果:Pulpie 能否在 Common Crawl 万亿规模上产出一个与 FineWeb 等数据集竞争的公开语料库?Feyn Labs 或第三方能否复现并验证其训练增益。
  3. 开源生态与部署工具完善:目前文档尚处于起步阶段,Pulpie 能否获得社区贡献的推理优化(如 ONNX 转换、vLLM 集成),将决定其能否被更广泛的生产环境接受。
GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 15099

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注