はじめに
自宅サーバーでエージェントをエンドツーエンドで訓練する際には、訓練データの生成と推論の挙動を安定して再現できる構成が不可欠です。ハーネス(推論支援ソフトウェア)を一体化すると、モデル呼び出しの依存や設定の違いが訓練ループの再現性を乱しやすくなります。ハーネスを分離する設計は、環境の違いを吸収しつつ、データ収集と検証を独立させることで、家庭用リソースでも信頼性の高い訓練を可能にします。
論文が提案する解決策は、軽量なプロキシを介してハーネスの呼び出しを受け取り、それを訓練データとして記録する仕組みと、Kubernetesのオーケストレーターを用いて各ロールアウトを独立したリモートコンテナで実行する構成です。これにより、ハーネスの差異や新規環境の追加が訓練ループ全体へ与える影響を分離でき、スケール訓練の再現性を高めます。
対象となるハーネスには Claude Code、Codex、OpenClaw などが例示され、GUIブラウザエージェントやツールベースのエージェントを含む多様な実装が示されています。家庭用サーバーでの検証では、これらの組み合わせに応じた設定の工夫とリソース