理論

A collection of 3 posts
AI・テクノロジー

エージェント安全性は行動のアライメントである ——『Agent Safety Is Action Alignment』論文解説

はじめに - なぜ"行動の安全性"が重要か 背景と問題設定 現代のエージェント型AIは、複雑な環境で自律的に行動する能力を持っています。しかし安全性を考える際、モデルの出力を拒否させる従来の枠組みだけでは十分でないことが指摘されています。出力の拒否はデータ内容の安全性を守る基本的手段ですが、実際の被害はエージェントが外部資源へアクセスする権限と、ユーザーが付与する権限の組み合わせに依存します。したがって「行動の安全性」は、モデル内部の重みだけでなく、アクション境界(least privilege outside the model)を設計することが不可欠です。 論文の核心主張 論文は、行動の安全性は「最小権限」を外部の境界で定義することで初めて成立すると主張します。安全性をモデル内在の拒否機能に依存させず、権限設計と外部制御の組み合わせで検証可能な行動指針を作るべきです。具体的には、ユーザーが与える権限と実行される行動の間に厳格な境界を設けることで、段階的な権限昇格や多段階のタスク実行時に生じるリスクを低減します。 graph TD User[ユーザー] -->|授与|
9 min read
AI・テクノロジー

複数のAIモデルを組み合わせれば本当に賢くなるのか?──67モデル大規模検証が暴いた『共倒れの壁』

1. はじめに: 最強のモデル1つ vs 複数モデルの組み合わせ、どちらが賢いのか 単独の最強モデルが常に最高の解を出すとは限らない。複数モデルを組み合わせるアプローチは長年期待されてきたが、理論と実験の両面から限界が指摘されている。核心となる指標は共倒れ率β(co-failure rate)で、βとは「全てのモデルが同時に誤る確率」を意味する。もしβが一定なら、ルーティングや投票、Mixture-of-Agentsを用いても出力の上限は原則1-βに抑えられる。モデル数を増やすだけでは、上限を超える大幅な性能向上は望みづらい。 この認識は、自宅サーバーでOSSの小型モデルを組み合わせて運用するエンジニアにも直結する。多様なモデルを活用するメリットはあるが、異質性の設計やクエリ信号の設計、エージェント間の協調戦略を工夫しないと、効果は限定的になる。 論文の実証では、67モデル・21プロバイダを対象に、数学タスク・コーディング・自由回答の三系統でβの上限を確認している。数学タスクではβ=0.052、コードではβ=0.079、自由回答ではβ=0.127程度が観測の目安として示された。こ
9 min read
科学・研究

The Self-Correction Illusion

はじめに 自己修正はAI・機械学習の核心テーマであり、自己評価と修正機構の成熟度が性能を左右する。本記事では Self-Correction Illusion の概念を定義し、背景・目的・論点の全体像を整理する。背景では理論と実装・検証手法の系譜を概観し、目的では本記事の狙いと構成を読者に提示する。 論文の要点と結論 本論の要点は、Self-Correction Illusion(自己修正の幻影)の中心的主張を整理する点にある。モデルの自己評価と修正が誤作動を招く事例を概観し、適用条件・限界を明示する。具体的には、自己評価の頻度、外部検証の導入、誤認識の原因分析と修正ループの抑制といった要素を検討する。結論では、現状の自己修正機構の信頼性には課題があるが、評価指標やデータ選択を工夫すれば改善可能と示される。貢献として、定義の明確化、技術と理論の整理、今後の研究課題の提案が挙げられる。 技術背景と先行研究 背景技術として、強化学習と自己教師あり学習は、モデルが外部指示だけでなく自己評価に基づき動作を改善する基盤を提供する。強化学習は報酬を最大化する試行錯誤の枠組みであり、自
4 min read