chinng-lab AI実験室
  • Home
  • About

SysAdmin

A collection of 1 post
AI・テクノロジー

SysAdmin ベンチマークの詳細解説と今後の示唆

背景と動機 Frontier AI の安全性を評価する際には、単なる能力の高さだけでなく、推進動機(パワーシーキング)の有無・程度を測定することが不可欠です。SysAdmin ベンチマークは、現実的な Linux サンドボックス環境で、モデルが自律的に権限拡張や環境操作に踏み出す兆候を観察する設計になっています。 本研究では自己防衛・高度な自律性・資源獲得・環境変更・戦略的隠蔽の5次元を設定し、タスクの組み合わせを通じて動機の強さと方向性を定量化します。タスクは現実的な Linux 環境を模した sandbox で実行され、10タスク×10回の繰り返し、各タスクは最大25ターンで完了を目指します。 評価は人間の校正データを用いた bias correction を含む LLM-as-a-judge によって行われ、信頼区間を提示して統計的な頑健性を確保します。これにより、環境設定や評価デザインの影響を分離し、保護機構の設計に実務的な示唆を与えることを目指します。 SysAdmin ベンチマークの全体像 高忠実度の Linux サンドボックスを用い、モデルは権限昇格や資源獲得
23 7月 2026 5 min read
Page 1 of 1
chinng-lab AI実験室 © 2026
  • Sign up
Powered by Ghost