推論効率

A collection of 2 posts
AI・テクノロジー

Models Take Notes at Prefill: KVキャッシュの編集可能性がもたらすLLM推論の新常識

はじめに アリババグループの研究機関であるAnt Groupから、大規模言語モデル(LLM)の推論効率を根本から変革する可能性を秘めた論文「Models Take Notes at Prefill: KV Cache Can Be Editable and Composable」が発表されました。本論文は、これまで「読み取り専用」と考えられてきたKVキャッシュを「編集可能」で「合成可能」なデータ構造として再定義するという、極めて野心的な提案を行っています。 著者らは、モデルが推論時に「ノートを取る(take notes)」という直感的な比喩を用いて、プレフィルフェーズにおける新しい情報処理パラダイムを提示しています。従来のTransformerアーキテクチャでは、KVキャッシュは過去のトークン情報を単に保存するだけの受動的なメモリ領域でした。本論文はこの前提に挑戦し、KVキャッシュを能動的に編集・合成可能な「思考のためのノート」として再定義しています。 本稿では、この革新的なアプローチの技術的詳細、実装方法、そして今後の展望について詳しく解説します。 背景と先行研究 KV
10 min read
科学・研究

Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning

はじめに Large Language Models(LLMs)のChain-of-Thought推論は高精度だが、推論コストが大きいという課題がある。本記事では、Batched Contextual Reinforcement(BCR)という手法を紹介する。BCRは1つの共有コンテキスト窓で複数の問題を同時に解決し、推論効率を向上させる設計である。5120トークンの予算制限下で3問同時処理の有効性が実証されており、実務的な観点からも注目される手法だ。 背景と関連研究 従来の手法では、長さペナルティ(L1、ShorterBetter、ALP)が勾配を不安定にしたり、Adaptive Reasoning(ARM、Thinker)やMulti-stage curriculaが設計負荷を高めたりする問題があった。BCRはこうした課題を解決する新たな設計思想で、共有資源の競合を活用することで推論のスループットと精度の両立を目指す。基盤技術として、Contextual Bandits、Batched Reinforcement Learning、GRPO(Group Relative P
2 min read