訓練データ

A collection of 1 post
AI・テクノロジー

In-Place Tokenizer Expansion for Pre-trained LLMs — 多言語デコード高速化の実践的拡張

はじめに 事前学習済みの大規模言語モデルは、初期データセットに基づいた固定の語彙表を前提に設計される。新規言語や新語の追加に対して柔軟性が低く、トークン化の断片化が発生するとデコード遅延や計算コストが増大する課題が生じる。こうした実務的な問題に対し、本手法はトークナイザーを"インプレース"で拡張する実用的なレシピを提案する。既存のBPEマージを維持しつつ、新規トークンを追加できる点が特徴である。追加トークンは source sub-token embeddings の平均を初期値として採用することで、埋め込み表の整合性を崩さずに新語を取り込むことができる。既存トークンの表現はそのまま保持され、継続性が保たれる。 提案は二段階の適用を前提とする。まず Embedding の訓練のみを行い、その後、全モデルの継続事前学習へ移行する。対象は LFM2-8B-A1B MoE の継続チェックポイントを128Kトークナイザーへ拡張する設定で、オンデバイス運用を前提とした現実的な適用性を検証する。実証結果では、ヒンディー語・ベトナム語・タイ語などでデコード速度が従来比およそ2.2〜3.7倍、Th
6 min read