外部監査

A collection of 1 post
AI・テクノロジー

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

はじめに Chain-of-Thought(CoT)推論は、問題を解く際に辿る思考の連鎖として現れる。近年の評価は主に最終解や自己一貫性の一貫度に焦点を当てることが多いが、推論の各段階で前提がどの程度影響しているかを直接測ることは難しい。そこで用いられるのが介入的 grounding audits である。介入とは、推論の特定の前提に用いられる述語を新規のシンボルへ置換し、再度推論を実行する操作を指す。前提の表現を変えると分岐の結果がどう変わるかを比較することで、各ステップでの前提依存性を定量的に捉えられる。これにより、表面的な正解と推論過程の乖離を検出する手掛かりが得られる。 本手法の意義は、自己一貫性ベースの評価だけでは見落としがちな推論過程の依存性を浮き彫りにする点にある。CoT推論は前提の真偽・構造に左右されやすく、同じ結論へ至る経路が複数存在しても、ある前提の操作で分岐が生じると結論が揺らぐ場合がある。前提依存性を分解して観察することで、モデルの推論過程の信頼性をより正確に評価できる。さらに、ブラックボックス的な外部観察の枠組みで評価を完結させる点も特徴の一つであり、公開
9 min read