
一句话看懂:开源项目 GigaToken 发布,可在多种 CPU 上将语言模型的分词速度提升数百至一千倍,并且能够直接替换现用的 HuggingFace Tokenizers 或 tiktoken,无需修改已有代码。
事件核心:发生了什么
GigaToken 是一个全新的开源分词器,支持几乎所有主流语言模型的分词方案(如 GPT-2、Llama 3、Qwen 3、DeepSeek V3、Phi-4 等)。其核心优势在于速度:在 144 核 AMD EPYC 服务器上,对 GPT-2 模型的分词吞吐量达到 24.53 GB/s,是 HuggingFace Tokenizers 的 989 倍、tiktoken 的 681 倍;在 M4 Max 笔记本上,同样达到 8.79 GB/s,相较于 HF 提升约 1268 倍。项目已开源在 GitHub,支持通过 pip install gigatoken 安装。它提供两种使用方式——兼容模式(API 行为与 HF 和 tiktoken 完全一致,速度会略有牺牲)以及原生 GigaToken API(可绕过 Python 开销,达到最高性能)。
为什么重要
分词是语言模型推理和训练中最基础但也最容易成为瓶颈的环节。当处理大规模文本数据(如预训练语料、RAG 索引、批量推理)时,传统工具即便用多线程 Rust 实现,速度也远低于现代 CPU 的 I/O 带宽。GigaToken 通过更底层的并行优化和直接文件读取,让分词不再是一个环节限制。这意味着:在大规模 NLP 应用中,原来“等分词完成”的场景可以直接变成“流式处理”,对数据预处理管线、实时应用和线上推理的延迟改善有直接价值。此外,无缝替代性降低了迁移成本,开发者在不需要重写代码的情况下即可获得大幅性能提升。
对用户/开发者/创作者的影响
对 AI 工程师和研究人员而言,最直接的受益是在预训练数据处理和批量推理场景中,等待时间可减少一个数量级以上。例如,处理 12 GB 文本数据集,原本需要几分钟的分词步骤,现在可以在几秒内完成。对 HuggingFace Tokenizers 和 tiktoken 的兼容模式意味着,现有 pipeline 只需改动一行导入代码即可使用,特别适合已经在用这些工具的团队。不过需要注意,兼容模式下的加速并非最高(据项目方说明,会“明显慢于原生 API”),如果在速度敏感场景,需要迁移到 GigaToken API 才能获益到极限。对于普通用户或内容创作者来说,这一变化短期内没有直接影响,但最终可能通过更低延迟的 API、更快的模型服务间接感受到产品响应速度的提升。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,GigaToken 是否能覆盖更复杂的分词场景,例如支持多语言预训练模型、自定义词汇表或特殊 token 映射,目前文档并未详尽说明。第二,HuggingFace 或 tiktoken 团队是否会跟进优化,将类似速度特性整合进主流行列。第三,项目目前由个人开发者维护,社区参与度和长期更新速度尚待观察。如果该项目能获得广泛采用并纳入主流框架(如 HuggingFace 的 Tokenizers 库、LangChain、vLLM),则可能成为基础组件的一次重要升级。
![[Bug]: Bug Report: Base64 Image String Being Split into Individual Characters](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9302-a8607eee-768x403.jpg)
![[Bug]: RAGFlow update knowledge base failed when modifying Page Rank with DOC_ENGINE=infinity](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9476-53eedc3e-768x403.jpg)
![[Question]: How to solve the problems of local image URL failure and embedding model binding failure](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9470-8ed01aaa-768x403.jpg)