GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

开源项目 GigaToken 发布,可在多种 CPU 上将语言模型的分词速度提升数百至一千倍,并且能够直接替换现用的 HuggingFace Tokenizers 或 tiktoken,无需修改已有代码。

GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

一句话看懂:开源项目 GigaToken 发布,可在多种 CPU 上将语言模型的分词速度提升数百至一千倍,并且能够直接替换现用的 HuggingFace Tokenizers 或 tiktoken,无需修改已有代码。

事件核心:发生了什么

GigaToken 是一个全新的开源分词器,支持几乎所有主流语言模型的分词方案(如 GPT-2、Llama 3、Qwen 3、DeepSeek V3、Phi-4 等)。其核心优势在于速度:在 144 核 AMD EPYC 服务器上,对 GPT-2 模型的分词吞吐量达到 24.53 GB/s,是 HuggingFace Tokenizers 的 989 倍、tiktoken 的 681 倍;在 M4 Max 笔记本上,同样达到 8.79 GB/s,相较于 HF 提升约 1268 倍。项目已开源在 GitHub,支持通过 pip install gigatoken 安装。它提供两种使用方式——兼容模式(API 行为与 HF 和 tiktoken 完全一致,速度会略有牺牲)以及原生 GigaToken API(可绕过 Python 开销,达到最高性能)。

为什么重要

分词是语言模型推理和训练中最基础但也最容易成为瓶颈的环节。当处理大规模文本数据(如预训练语料、RAG 索引、批量推理)时,传统工具即便用多线程 Rust 实现,速度也远低于现代 CPU 的 I/O 带宽。GigaToken 通过更底层的并行优化和直接文件读取,让分词不再是一个环节限制。这意味着:在大规模 NLP 应用中,原来“等分词完成”的场景可以直接变成“流式处理”,对数据预处理管线、实时应用和线上推理的延迟改善有直接价值。此外,无缝替代性降低了迁移成本,开发者在不需要重写代码的情况下即可获得大幅性能提升。

对用户/开发者/创作者的影响

对 AI 工程师和研究人员而言,最直接的受益是在预训练数据处理和批量推理场景中,等待时间可减少一个数量级以上。例如,处理 12 GB 文本数据集,原本需要几分钟的分词步骤,现在可以在几秒内完成。对 HuggingFace Tokenizers 和 tiktoken 的兼容模式意味着,现有 pipeline 只需改动一行导入代码即可使用,特别适合已经在用这些工具的团队。不过需要注意,兼容模式下的加速并非最高(据项目方说明,会“明显慢于原生 API”),如果在速度敏感场景,需要迁移到 GigaToken API 才能获益到极限。对于普通用户或内容创作者来说,这一变化短期内没有直接影响,但最终可能通过更低延迟的 API、更快的模型服务间接感受到产品响应速度的提升。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,GigaToken 是否能覆盖更复杂的分词场景,例如支持多语言预训练模型、自定义词汇表或特殊 token 映射,目前文档并未详尽说明。第二,HuggingFace 或 tiktoken 团队是否会跟进优化,将类似速度特性整合进主流行列。第三,项目目前由个人开发者维护,社区参与度和长期更新速度尚待观察。如果该项目能获得广泛采用并纳入主流框架(如 HuggingFace 的 Tokenizers 库、LangChain、vLLM),则可能成为基础组件的一次重要升级。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 14748

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注