2026年9月21日 09:00
tokenizers v1、最大30倍の高速化を実現
tokenizers v1: encode, decode and scaling, measured
3行まとめ
- •Hugging Faceがtokenizers v1公開
- •単一スレッドで最大30倍高速化
- •出力トークンIDは従来と完全互換
詳細
背景
これまでのtokenizersは「ボトルネックにならない」という前提で設計されていたが、LLMの推論・学習が高速化・大規模化するにつれ、トークン化処理自体が処理全体の律速要因になりつつあった。特に大量データでの学習、多数の同時推論リクエスト、長文の反復処理でこの傾向が顕著だった。
内容
Hugging Faceは内部実装を刷新したtokenizers v1を公開した。単語をスレッドローカルにキャッシュして再計算を避ける仕組みや、マージ処理をリンクリスト構造の平坦配列で行う再設計、SIMD命令を使ったビットストリーム操作による正規表現処理の高速化などを導入した。decode処理も中間文字列を経由せず再利用バッファに直接書き込むよう変更した。Apple M4 Max上のシングルスレッド計測では、モデルによって旧版比3〜30倍の高速化を確認し、8ワーカーでのマルチスレッド性能も線形スケーリングの76%を達成した。出力されるトークンIDは旧版と完全に同一で、既存パイプラインへの互換性は保たれている。
今後の影響
Transformersなど下流ライブラリはこの高速化の恩恵を自動的に受けられる見込みで、推論時にGPUがトークナイザー処理待ちで遊ぶ時間の削減が期待される。今後はPython・Node.js・C++・Swift・Go等への言語バインディング拡充や、GPU上で直接バッチエンコードを行う「tok-devices」構想も予定されている。
なぜ重要か
トークナイザー処理を最大30倍高速化し、出力トークンIDは従来と同一で既存パイプラインへの影響もない。
元記事を読む — Hugging Face Blog