Transformer

A collection of 2 posts
AI・テクノロジー

AIがAIの学習方法を発明する時代へ:OPTScientistが切り拓く自動オプティマイザ設計

はじめに:最適化アルゴリズム設計の難しさ 大規模トランスフォーマーの事前学習では、最適化戦略が学習効率と性能を大きく左右します。学習率のスケジューリングやオプティマイザの選択ひとつで、収束速度も汎化性能も変わってしまうのです。しかし、従来の最適化手法はAdamやAdamWなど固定設計が主流で、モデルやデータセットに適した戦略を自動設計することは長らく困難でした。 この課題に正面から挑んだのが、今回紹介する「OPTScientist」です。OPTScientistは、複数のAIエージェントが協調して最適化プログラムを自動探索・発見するフレームワークであり、人手による試行錯誤を大幅に削減する可能性を秘めています。 OPTScientistの全体像 OPTScientistの中核は、Theorist(理論家)・Designer(設計者)・Engineer(実装者)・Reviewer(評価者) という4つの役割を持つAIエージェントが協調し、Typed Optimizer Programs(型付き最適化プログラム)を自動で発見・評価・統合する枠組みです。 各エージェントは異なる観点
5 min read
AI・テクノロジー

LISA: Linear-Indexed Sparse Attentionが切り拓く長文LLM推論の新境地

はじめに(概要) 長大な文脈を扱う Transformer 系モデルでは、自己注意機構の計算量とメモリ使用量がボトルネックになる。自己注意は入力長 N の全トークン間でスコアを算出・加重和を取るため、計算量は O(N^2)、メモリは O(N^2) に膨張する。N が大きくなるほど推論・訓練のコストは急増する。 この課題を解決するために、Linear-Indexed Sparse Attention(LISA)と呼ばれる新しい設計が提案されている。インデックスを工夫してトークン間の接続を制限し、注意計算をスパース化することで長文処理を現実的にする手法だ。 LISA は固定または動的なインデックス選択を用い、必要に応じて局所的な結合と適度な長距離結合を組み合わせる設計を採用する。計算量は線形時間またはそれに準じるスケーリングを目標とする一方で、重要な依存関係をできる限り保持することを目指す。 期待効果として、推論時のピークメモリを削減し、バッチサイズやトークン長の柔軟性を高めることが挙げられる。長文での読解・要約・QA などの応用領域で実用性が高まる可能性がある。ただし、スパースパ
10 min read