标签: NLP

清除筛选

Gigatoken:比 HuggingFace 快 1000 倍的开源分词器

大语言模型训练的第一步是把文本切成 token。这个过程看似简单,实际上在万亿 token 级别的数据集上极其耗时。2026 年 7 月,斯坦福博士生 Marcel Rød 发布了开源分词器 Gigatoken,在主流 BPE 词表上实现了比 HuggingFace tokenizers 快 500 到 1000 倍的吞吐速度,比 OpenAI 的 tikt…

开源AINLP