はじめに
この研究では、LLMエージェントに手続き的スキルを組み込んでも、必ずしもすべてのタスクで性能が向上するわけではないことを示す。スキルの影響を「ゲイン」と「回帰」という二つの観点で分解する新しい評価フレームワークを提案し、約6,000回の実験を横断して検証した。結果は、スキルがタスクを解決する力を高める場面もある一方で、別の視点では全体の成績を落とすケースが存在することを明らかにしている。
この逆説的結論の背景には、学習過程の解釈と文脈依存性が関係している。最も重要な発見は、優れたスキルが単純に「成功を増やす」ことよりも「失敗を抑える」ことに寄与する点で、ゲインと回帰のバランスを適切に測ることが信頼性の高い設計につながる、という点だ。グラウンディングと検証は、スキル導入時の不確かさを抑える核となる設計指針として強調される。
本論文では、回帰を生む三つのメカニズムを定義し、それぞれの抑制策を整理する。さらに、実務を見据え、評価指標をゲインと回帰に分解して用いる設計の重要性と、現場での適用可能性を議論する。
技術解説: Regression Tax の定義と3つの回帰メカ