Gigatoken
Gigatoken 是一个开源 Rust 分词器,带 Python 绑定,编码速度能到每秒数 GB,定位是 HuggingFace Tokenizers 和 OpenAI tiktoken 的直接替代品。它支持 23 个分词器家族的 byte-pair encoding,从 GPT-2 一路覆盖到 Llama 4、Qwen、DeepSeek、Gemma。
斯坦福在读博士 Marcel Rød 在 2026 年 7 月 21 日公布了这个项目,在一台 144 核 AMD EPYC 服务器上测出比 HuggingFace 快最高 989 倍、比 tiktoken 快 681 倍。第二天登上 Hacker News,拿到 615 分,72 小时内就有人做出了 Ruby、Swift、llama.cpp 移植版。
训练前要把成堆文本处理成 token,这事以前像用水桶接力传水,Gigatoken 相当于直接换成了消防水枪。
这词最值得国内团队关注的一点,是它把 Qwen、DeepSeek 这些国产模型的 tokenizer family 也纳进了兼容列表,跑预训练/微调数据预处理的团队能直接受益,不是纯粹的欧美生态工具。目前没看到系统的中文教程或选型测评,英文那边 HN 讨论和几个语言移植版已经先跑起来了,写中文向导或对比测评还来得及占位。
提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。
为什么现在开始走红?
斯坦福在读博士 Marcel Rød 7 月 21 日发的推文,声称做出了一个快 1000 倍左右的 Rust 分词器,第二天就上了 Hacker News 首页 (615 分,119 条评论),KrabArena 上独立测出比 tiktoken 快 26 倍,72 小时内又冒出了 Swift、Ruby、llama.cpp 移植版。
搜索热度
-
萌芽0–7 天
-
初现 ← 当前8–30 天
-
验证中31–90 天
-
上升91–180 天
-
成熟180 天以上
前景
未来 6 个月的热度走势与商业化节奏。
HN 上首页加上 72 小时内三个独立语言移植版,说明开发者工具这波采用速度很快,但分词速度本身是个窄且容易被商品化的细分领域。
风险 · 如果模型架构转向 byte-level 或干脆不用 tokenizer,Gigatoken 加速的这个问题本身可能就被绕过去了。
类比 · tiktoken · simdjson · HuggingFace Tokenizers
-
现在MIT 开源协议,还没有产品
一个博士生做的免费 pip/cargo 库,没有公司、没有定价、也没有托管服务。
-
3-6 个月包装层和托管 API
预计会出现托管的预处理 API 和流水线插件,服务那些不想自己编译 Rust 的团队。
-
6-12 个月被上游吸收的风险
HuggingFace 或模型厂商很可能把这套技术直接并进自己官方的分词器里。
“Gigatoken” 的竞争与机会
判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。
“Gigatoken” 能做的点子
这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。
目前还没有专门的对比内容。可以讲兼容模式、速度取舍,以及到底哪些分词器家族是真支持的。
用 Gigatoken 的兼容模式做一步步迁移教程,这个模式能保证输出和原来字节级一致。
把原始吞吐量数字换算成常见数据集规模下能省下的实际预处理时间。
把 Gigatoken 包在一个托管 API 后面,让团队不用编译 Rust 扩展也能拿到加速效果。
标出哪些分词器配置下,Gigatoken 的快速路径输出和它包装的 HuggingFace 分词器悄悄不一致了。
把 Rust、Swift、Ruby、C++ 各个移植版聚合起来,新移植版出现就同步更新实时吞吐量数字。
录屏对比 Gigatoken 和 tiktoken、HuggingFace 在真实大数据集上的实际耗时。
Marcel Rød 不在 OpenAI 也不在 Anthropic,他是个斯坦福博士生,晚上手写 SIMD 状态机,做出来的东西比 HuggingFace 自家库快了 989 倍。
所有人都盯着 GPU 利用率,忘了矩阵乘法开始之前那一步是 CPU 密集的,Gigatoken 刚证明这一步里藏着 1000 倍的加速空间。
一个周末换了个分词库,把六小时的预处理压到了二十二分钟。
大家在搜什么
来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。
“Gigatoken” 的搜索结果
这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。
常见问题
什么是 Gigatoken?
Gigatoken 是一个开源 Rust 分词器,带 Python 绑定,编码速度能到每秒数 GB,定位是 HuggingFace Tokenizers 和 OpenAI tiktoken 的直接替代品。它支持 23 个分词器家族的 byte-pair encoding,从 GPT-2 一路覆盖到 Llama 4、Qwen、DeepSeek、Gemma。
Gigatoken 为什么现在火?
斯坦福在读博士 Marcel Rød 7 月 21 日发的推文,声称做出了一个快 1000 倍左右的 Rust 分词器,第二天就上了 Hacker News 首页 (615 分,119 条评论),KrabArena 上独立测出比 tiktoken 快 26 倍,72 小时内又冒出了 Swift、Ruby、llama.cpp 移植版。
Gigatoken 是什么时候出现的?
约于 2026-07-21 公开出现(截至 2026-08-11 约 21 天前)。EarlyTerms 最早于 2026-07-22 记录到信号。
相关词
同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。
- 属于
- 包含
- 竞品
- 相关
来源
这份报告引用的一手链接,点开任意一条都能自己核对。
- 01 marcelroed/gigatoken — GitHub 仓库 github.com ↗
- 02 Hacker News 讨论 news.ycombinator.com ↗
- 03 Marcel Rød 首次发布公告 (X/Twitter) twitter.com ↗
- 04 MarkTechPost 报道 marktechpost.com ↗
- 05 Data Science in Your Pocket (Medium) 报道 medium.com ↗
- 06 gigatoken on PyPI pypi.org ↗
- 07 gigatoken-rb — Ruby 移植版 github.com ↗