Lin
Lin博客
记录技术与生活
692
文章
926
标签
标签
AI (261)Apple (59)开源 (52)安全 (41)Google (39)芯片 (37)Anthropic (36)OpenAI (35)科技 (31)网络安全 (29)互联网 (28)大模型 (21)健康 (19)隐私 (19)DeepSeek (17)半导体 (16)游戏 (16)Claude (16)NVIDIA (16)开发者工具 (15)NLP (1)
热门推荐
  • Anthropic 洽谈由三星代工自研 AI 芯片
    7/2/2026
  • 长鑫存储拿下腾讯200亿DRAM大单:IPO前的战略绑定
    6/29/2026
  • xAI 开源 Grok Build:Rust 编写的终端编程代理
    7/15/2026
  • 苹果 A20 Pro 改用 WMCM 封装,内存移至芯片侧面改善散热
    6/27/2026
  • 美国政府要求 OpenAI 分阶段发布 GPT-5.6
    6/26/2026
  • OPPO 整合一加与真我系统,全球统一启用 ColorOS
    7/3/2026
  • Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署
    6/27/2026
  • 华为开源 920 亿参数 openPangu-2.0-Flash 模型
    6/30/2026

标签: NLP

清除筛选
    Gigatoken:比 HuggingFace 快 1000 倍的开源分词器
    Gigatoken:比 HuggingFace 快 1000 倍的开源分词器

    大语言模型训练的第一步是把文本切成 token。这个过程看似简单,实际上在万亿 token 级别的数据集上极其耗时。2026 年 7 月,斯坦福博士生 Marcel Rød 发布了开源分词器 Gigatoken,在主流 BPE 词表上实现了比 HuggingFace tokenizers 快 500 到 1000 倍的吞吐速度,比 OpenAI 的 tiktoken 快约 100 倍。

    ![Marcel Rød 在 X 上发布 Gigatoken](https://linlog.top/api/uploads/2026/07/1784761605984442021-1419655ccc17e

    7/22/2026开源AINLP
Lin Blog记录技术、互联网与日常观察
AboutContactPrivacy