効率的推論

A collection of 2 posts
AI・テクノロジー

Stop Overthinking: 大規模言語モデルにおける効率的推論の総説

背景と問題設定 巨大言語モデル(LLM)の推論は、実運用における計算リソース、応答時間、エネルギー消費に直結する重要な要素です。高品質な出力を維持しつつ、遅延を抑え、運用コストを削減することが現場の共通課題となっています。特にCoT(チェーン・オブ・ソート)やBest-of-Nなどの推論戦略は、性能を高める一方で推論時の計算量を大幅に増やし、実用適用のハードルを高めます。 本論文は、推論の効率化を「モデルベース」「出力ベース」「入力ベース」の3視点に整理します。モデルベースはパラメータ効率化や蒸留、Early Exit、量子化・剪定・スパース化など、推論時の内部計算を抑える設計指向の技法を指します。出力ベースは推論チェーンの設計・経路選択、不要な推論ステップの削減、要約・再利用、動的経路決定など、生成過程を軽量化する手法を含みます。入力ベースはプロンプト設計・データ活用の最適化で、同等の性能を保ちながら入力計算量を削減するアプローチです。 本総説は、これらのカテゴリごとに代表的な技法と、効率と性能のトレードオフを整理・比較します。現場では、評価基準の標準化やベンチマーク整備、コス
8 min read
AI・テクノロジー

LISA: Linear-Indexed Sparse Attentionが切り拓く長文LLM推論の新境地

はじめに(概要) 長大な文脈を扱う Transformer 系モデルでは、自己注意機構の計算量とメモリ使用量がボトルネックになる。自己注意は入力長 N の全トークン間でスコアを算出・加重和を取るため、計算量は O(N^2)、メモリは O(N^2) に膨張する。N が大きくなるほど推論・訓練のコストは急増する。 この課題を解決するために、Linear-Indexed Sparse Attention(LISA)と呼ばれる新しい設計が提案されている。インデックスを工夫してトークン間の接続を制限し、注意計算をスパース化することで長文処理を現実的にする手法だ。 LISA は固定または動的なインデックス選択を用い、必要に応じて局所的な結合と適度な長距離結合を組み合わせる設計を採用する。計算量は線形時間またはそれに準じるスケーリングを目標とする一方で、重要な依存関係をできる限り保持することを目指す。 期待効果として、推論時のピークメモリを削減し、バッチサイズやトークン長の柔軟性を高めることが挙げられる。長文での読解・要約・QA などの応用領域で実用性が高まる可能性がある。ただし、スパースパ
10 min read