LLMエージェント

A collection of 3 posts
AI・テクノロジー

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

設計思想と読者の疑問に答える導入 長距離エージェント軌跡には、単発のエラーでは説明できない複雑な因果関係が潜んでいます。TrajDebugの設計思想は、致命的エラーの所在を特定するための実用的な枠組みを提供することにあります。長い履歴を等分に見渡すのではなく、重要な転換点を抽出して原因と影響を結びつけ、エラーの発生に至る過程を可視化します。長期軌跡における信号は微弱で散逸しやすく、局所情報だけでは判断が難しいため、履歴圧縮の考え方を導入して局所情報を要点だけに集約します。 この難しさへの対処は、伝統的なデバッグ手法とは一線を画します。従来のデバッグは短期の挙動や単一イベントの再現性に依存することが多いですが、長時間の決定をまたぐ影響は累積的であり、因果関係の証拠をエビデンスとして結びつける必要があります。証拠ベースのエラー特定とクリティカル属性追跡の組み合わせにより、最終的な失敗に至る前段階の手掛かりを追跡できる設計を志向しています。 読者が本稿から得られるのは、長い軌跡のデバッグを現実的な手順と指針に落とし込む方法です。履歴の要点抽出、原因と結果の結びつけ方、実務での運用上の留
6 min read
AI・テクノロジー

Agentic Skill Discovery: 対話を通じて再利用可能なスキルを学習するLLMエージェント

はじめに 本稿では、論文「Agentic Skill Discovery: LLM Agents that Learn Reusable Skills Through Interaction」を紹介します。本研究は、対話を通じて再利用可能な技能(スキル)を学習するLLMエージェントの設計を目指しています。エージェントは環境と対話する中で新たなスキルを自律的に発見し、それを将来のタスクへ再利用可能な形で蓄積します。 本論文が解決しようとする課題は、膨大な情報と操作手順の中から有用な技能を自動的に見つけ出し、再利用可能な形で整理する方法の不足です。従来のエージェントは特定タスクに特化しやすく、他タスクへの転用が難しいという問題を抱えています。本研究は、Knowledge Graph(LightRAG / GraphRAG など)と対話を組み合わせて、技能の発見・抽出・再利用のサイクルを導入する点が特徴です。 背景と動機 現在のLLMエージェントは、訓練済みの知識に依存し固定化されがちで、環境の変化に対する適応が遅いという限界があります。深い専門性を要するタスクでは再利用性が乏
9 min read
AI・テクノロジー

LLMエージェント、全部盛りは逆効果?──5大コンポーネントの「相互干渉」が明かす意外な事実

はじめに LLMエージェントを構築する際、計画、ツール、Memory、自己内省、情報取得の5要素をすべて組み込む「全部盛り」が最善策と思われがちだ。しかし、論文「More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding」は、これら5要素を32通り組み合わせた総当たり実験により、All-In構成が必ずしも最適でないことを示した。タスクによって最適なサブセットは異なり、エンジニアはShapley値やサブモジュラ性の分析を活用し、Greedy拡張に頼らない設計を心がけるべきだ。 CCI とは何か Cross-Component Interference(CCI)とは、5つのスキャフォールディング要素(計画、ツール、Memory、Self-Reflection、Retrieval)を2^5=32通り組み合わせた際に生じる相互作用効果を指す。全てを足し合わせても必ずしも性能が最適化されず、ある組み合わせが他を干渉して低下する現象だ。HotpotQAやGSM8Kの実験では、1つのツール構
4 min read