はじめに - 論文の概要と結論
Pelican-Unified 1.0 は、理解・推論・想像・行動を一つの embodied foundation model に統合する初の試みです。単一のビジョン・言語モデル(VLM)を統一理解モジュールとして用い、シーン・指示・視覚文脈・行動履歴を共通空間へマッピングします。同一VLMが推論を担うことで、タスク選択と未来志向の思考の連鎖を自動生成します。Unified Future Generator(UFG)は潜在変数 z を条件に将来の動画と動作を同時に生成します。訓練は言語・動画・動作の損失を共有する方式で、一体的な表現を強化します。VLMベンチマーク8種で64.7、WorldArenaで66.03、RoboTwinで93.5の高スコアを達成しています。
背景と先行研究
従来は理解・推論・動作を分離した専門モデルを段階的に組み合わせる設計が一般的でした。分離設計はデータ整合性・学習効率・リアルタイム性の課題を生みやすく、モジュール間の橋渡しで誤差伝播や遅延が発生します。