はじめに - なぜ"行動の安全性"が重要か
背景と問題設定
現代のエージェント型AIは、複雑な環境で自律的に行動する能力を持っています。しかし安全性を考える際、モデルの出力を拒否させる従来の枠組みだけでは十分でないことが指摘されています。出力の拒否はデータ内容の安全性を守る基本的手段ですが、実際の被害はエージェントが外部資源へアクセスする権限と、ユーザーが付与する権限の組み合わせに依存します。したがって「行動の安全性」は、モデル内部の重みだけでなく、アクション境界(least privilege outside the model)を設計することが不可欠です。
論文の核心主張
論文は、行動の安全性は「最小権限」を外部の境界で定義することで初めて成立すると主張します。安全性をモデル内在の拒否機能に依存させず、権限設計と外部制御の組み合わせで検証可能な行動指針を作るべきです。具体的には、ユーザーが与える権限と実行される行動の間に厳格な境界を設けることで、段階的な権限昇格や多段階のタスク実行時に生じるリスクを低減します。
graph TD
User[ユーザー] -->|授与|