トークンコスト

A collection of 2 posts
AI・テクノロジー

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

はじめに 自己改善手法とは、モデルが出力を一度で提出するのではなく、出力を批評・検討し、必要に応じて修正を加える一連の推論プロセスを指します。Self-Refine、Reflexion、Debate、Tree of Thoughts といったアプローチは、内部の推論経路を自己検証することで、最終回答の信頼性を高めようとします。推論の設計においては、どれくらいの計算資源を使うか、どの程度の回答の安定性を許容するかが重要な選択となります。 ローカル環境での推論では、推論資源と精度のトレードオフが特に重要です。トークンコストと実行時間が制約条件となる中、同じトークン予算で繰り返しサンプリングを行い、複数の見解を統合する方法は、しばしば単発の推論よりも正確性と再現性を高める効果を持ちます。とはいえ、自己改善の効果はモデルサイズに依存します。小型モデルでは反復による情報追加が有効に働くことが多い一方、サイズが大きくなると追加の反省から得られる価値が相対的に低下する傾向があります。 本論文の実証では、1.5B・3B・7Bのモデルサイズと150問×2のベンチマーク、ブートストラップ信頼区間・多
7 min read
AI・テクノロジー

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

はじめに AIエージェントは近年、推論能力だけでなく、思考の文脈をどう保持し活用するかという問題に直面しています。会話履歴やツール定義、ツールの出力といった文脈が増えると、メモリの消費が膨れ上がり、トークンコストの二次関数的な上昇を招きます。結果として、長い対話の中で必要な情報を正しく思い出すリコール精度が低下することがあります。 この課題を単なる保存・検索の問題として捉えるのではなく、ライフサイクルとアーキテクチャの問題として捉え直す新しい設計思想が求められています。Agentic Context Management、略して ACM はこの領域を整理する枠組みで、思考の文脈をどう覚え、どう忘れ、どう取り出すかを体系化します。5つのプリミティブ(設計・取り込み・スコープ・予測・圧縮統合)を軸に、コストと忠実度のトレードオフを実践的に解決する道を提案します。家庭用サーバー等の限られた環境でも効果が見込める設計であり、本記事ではその全体像と実践的な適用方法を解説します。 ACMの5つのプリミティブ AIエージェントの思考履歴をどう選別・格納するかは設計の核心です。ACMはメモリ
5 min read