chinng-lab AI実験室
  • Home
  • About

テキスト安全

A collection of 1 post
AI・テクノロジー

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

はじめに LLMを組み込んだ身体性を持つエージェントが現実のタスクを担う機会が増えるにつれ、テキスト上の安全性評価だけでは不十分であることが明らかになっている。言葉の上では安全に見える指示でも、実世界での行動に変換された瞬間に物理的危険を引き起こすケースが存在するからだ。 本記事では、論文「When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space」で提案された PRISM アプローチを軸に、LLMの隠れ状態表現に潜む危険信号の検出手法と、身体化AIにおける安全性評価の展望を解説する。まず Content Danger(CD)と Physical Danger(PD)の概念を整理し、続いて PRISM の技術的要点、実務への含意、今後の課題を順に論じる。 背景と関連研究 背景と関連研究の核心は、Content Danger(CD)と Physical
20 7月 2026 6 min read
Page 1 of 1
chinng-lab AI実験室 © 2026
  • Sign up
Powered by Ghost