複数モデル

A collection of 3 posts
AI・テクノロジー

複数のAIモデルを組み合わせれば本当に賢くなるのか?──67モデル大規模検証が暴いた『共倒れの壁』

1. はじめに: 最強のモデル1つ vs 複数モデルの組み合わせ、どちらが賢いのか 単独の最強モデルが常に最高の解を出すとは限らない。複数モデルを組み合わせるアプローチは長年期待されてきたが、理論と実験の両面から限界が指摘されている。核心となる指標は共倒れ率β(co-failure rate)で、βとは「全てのモデルが同時に誤る確率」を意味する。もしβが一定なら、ルーティングや投票、Mixture-of-Agentsを用いても出力の上限は原則1-βに抑えられる。モデル数を増やすだけでは、上限を超える大幅な性能向上は望みづらい。 この認識は、自宅サーバーでOSSの小型モデルを組み合わせて運用するエンジニアにも直結する。多様なモデルを活用するメリットはあるが、異質性の設計やクエリ信号の設計、エージェント間の協調戦略を工夫しないと、効果は限定的になる。 論文の実証では、67モデル・21プロバイダを対象に、数学タスク・コーディング・自由回答の三系統でβの上限を確認している。数学タスクではβ=0.052、コードではβ=0.079、自由回答ではβ=0.127程度が観測の目安として示された。こ
9 min read
AI・テクノロジー

Lean4Agent入門 ── 形式言語Lean4でLLMエージェントワークフローを検証する初のフレームワーク

論文情報: Ruida Wang, Jerry Huang, Pengcheng Wang, Xuanqing Liu, Luyang Kong, Tong Zhang, "Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory", arXiv:2606.06523v1(2026年6月8日公開) Lean4Agentとは何か Lean4Agentは、LLMの多段階ワークフローの信頼性を、依存型の形式言語 Lean4 を用いてモデル化・検証する初のフレームワークである。中核となるのは FormalAgentLib であり、明示的な仮定のもとでエージェントワークフローの意味的一貫性を検証する拡張可能な Lean4 ライブラリとして機能する。さらに LeanEvolve は、この検証結果を受けてワークフローを改良する機構として位置づけられる。大規模評価では、SWE-Bench-Verified の難易度サブセットと ELAIP-Bench
4 min read
科学・研究

Do Sparse Autoencoders Capture Concept Manifolds?

はじめに SAEは、概念を独立直線方向として表現する仮定のもとで解釈性を高める代表的手法だ。だが本論文は、概念は低次元の多様体として幾何関係を持つ場合が多いと指摘する。希薄化の効果と、グローバルな線形包と局所的なタイル化という二つの捉え方を通じ、概念空間の構造を再考する。これにより、今後の表現学習で幾何を定義付きで扱い、解釈性と再現性を両立させる指針が得られる。 背景と関連研究 背景として、概念多様体と線形方向の対比を軸に、SAEは従来のdictionary learningやsparse codingに基づく特徴抽出と異なる解釈を提供する。概念は多様体として幾何関係をエンコードする場合が多く、SAEがグローバルな線形包で全多様体を捉えうるかは未検証の課題である。関連研究には Projecting Assumptions、The Geometry of Concepts、Universal Sparse Autoencoders などがあり、複数モデル間の共通概念やグローバル/ローカル捉え方の位置づけを示す。これらを踏まえ、本論はグローバルとローカルの二重視点を整理し、希薄化(
3 min read