はじめに(概要)
長大な文脈を扱う Transformer 系モデルでは、自己注意機構の計算量とメモリ使用量がボトルネックになる。自己注意は入力長 N の全トークン間でスコアを算出・加重和を取るため、計算量は O(N^2)、メモリは O(N^2) に膨張する。N が大きくなるほど推論・訓練のコストは急増する。
この課題を解決するために、Linear-Indexed Sparse Attention(LISA)と呼ばれる新しい設計が提案されている。インデックスを工夫してトークン間の接続を制限し、注意計算をスパース化することで長文処理を現実的にする手法だ。
LISA は固定または動的なインデックス選択を用い、必要に応じて局所的な結合と適度な長距離結合を組み合わせる設計を採用する。計算量は線形時間またはそれに準じるスケーリングを目標とする一方で、重要な依存関係をできる限り保持することを目指す。
期待効果として、推論時のピークメモリを削減し、バッチサイズやトークン長の柔軟性を高めることが挙げられる。長文での読解・要約・QA などの応用領域で実用性が高まる可能性がある。ただし、スパースパ