标签
热门推荐
- Anthropic 洽谈由三星代工自研 AI 芯片7/2/2026
- 长鑫存储拿下腾讯200亿DRAM大单:IPO前的战略绑定6/29/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 苹果 A20 Pro 改用 WMCM 封装,内存移至芯片侧面改善散热6/27/2026
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- OPPO 整合一加与真我系统,全球统一启用 ColorOS7/3/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
标签: NLP
清除筛选Gigatoken:比 HuggingFace 快 1000 倍的开源分词器
大语言模型训练的第一步是把文本切成 token。这个过程看似简单,实际上在万亿 token 级别的数据集上极其耗时。2026 年 7 月,斯坦福博士生 Marcel Rød 发布了开源分词器 Gigatoken,在主流 BPE 词表上实现了比 HuggingFace tokenizers 快 500 到 1000 倍的吞吐速度,比 OpenAI 的 tiktoken 快约 100 倍。
