はじめに
アリババグループの研究機関であるAnt Groupから、大規模言語モデル(LLM)の推論効率を根本から変革する可能性を秘めた論文「Models Take Notes at Prefill: KV Cache Can Be Editable and Composable」が発表されました。本論文は、これまで「読み取り専用」と考えられてきたKVキャッシュを「編集可能」で「合成可能」なデータ構造として再定義するという、極めて野心的な提案を行っています。
著者らは、モデルが推論時に「ノートを取る(take notes)」という直感的な比喩を用いて、プレフィルフェーズにおける新しい情報処理パラダイムを提示しています。従来のTransformerアーキテクチャでは、KVキャッシュは過去のトークン情報を単に保存するだけの受動的なメモリ領域でした。本論文はこの前提に挑戦し、KVキャッシュを能動的に編集・合成可能な「思考のためのノート」として再定義しています。
本稿では、この革新的なアプローチの技術的詳細、実装方法、そして今後の展望について詳しく解説します。
背景と先行研究
KV