はじめに
LLMを組み込んだ身体性を持つエージェントが現実のタスクを担う機会が増えるにつれ、テキスト上の安全性評価だけでは不十分であることが明らかになっている。言葉の上では安全に見える指示でも、実世界での行動に変換された瞬間に物理的危険を引き起こすケースが存在するからだ。
本記事では、論文「When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space」で提案された PRISM アプローチを軸に、LLMの隠れ状態表現に潜む危険信号の検出手法と、身体化AIにおける安全性評価の展望を解説する。まず Content Danger(CD)と Physical Danger(PD)の概念を整理し、続いて PRISM の技術的要点、実務への含意、今後の課題を順に論じる。
背景と関連研究
背景と関連研究の核心は、Content Danger(CD)と Physical