ローカルLLM

A collection of 3 posts
AI・テクノロジー

2026年8月のLLMモデルラッシュ:クラウド・オープンウェイト・軽量の三極集中

はじめに 2026年7月下旬から8月上旬――わずか2週間のあいだに、AI業界全体が「LLMモデルリリースの集中砲火」に見舞われました。 OpenAI、Anthropic、Google、Alibaba、xAI、Moonshot AI、Liquid AI……主要プレイヤーがほぼ同時期に次世代LLMモデルを叩きつけたのです。フロンティア級のクラウドAPIモデルから、2兆パラメータ超のオープンウェイト、そしてスマホで動く2.6Bの超小型モデルまで。まるで、誰かが号砲を鳴らしたかのように、すべての会社が一斉に走り出しました。 これは偶然ではありません。大統領令EO 14409の期限、Q3リソース配分の区切り、そして「ライバルが出すなら自分も出す」という競争の連鎖反応が、この時期にすべてのタイマーを同調させたのです。 本記事では、この「2026年最大のモデル戦争」を3つのカテゴリに分けて解剖します。第1部ではGPT-5.6やQwen3.8-Maxといったクラウド専売のフロンティアモデルを取り上げ、第2部ではKimi K3(2.8T)やGLM-5.2など大規模オープンウェイトモデルの台頭を追
13 min read
AI・テクノロジー

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

はじめに 自己改善手法とは、モデルが出力を一度で提出するのではなく、出力を批評・検討し、必要に応じて修正を加える一連の推論プロセスを指します。Self-Refine、Reflexion、Debate、Tree of Thoughts といったアプローチは、内部の推論経路を自己検証することで、最終回答の信頼性を高めようとします。推論の設計においては、どれくらいの計算資源を使うか、どの程度の回答の安定性を許容するかが重要な選択となります。 ローカル環境での推論では、推論資源と精度のトレードオフが特に重要です。トークンコストと実行時間が制約条件となる中、同じトークン予算で繰り返しサンプリングを行い、複数の見解を統合する方法は、しばしば単発の推論よりも正確性と再現性を高める効果を持ちます。とはいえ、自己改善の効果はモデルサイズに依存します。小型モデルでは反復による情報追加が有効に働くことが多い一方、サイズが大きくなると追加の反省から得られる価値が相対的に低下する傾向があります。 本論文の実証では、1.5B・3B・7Bのモデルサイズと150問×2のベンチマーク、ブートストラップ信頼区間・多
7 min read
AI・テクノロジー

2026年のエッジAI革命:スモール言語モデル(SLM)が変えるオンデバイス推論の未来と実践ガイド

2026年、AIの世界は静かながらも確実なパラダイムシフトの只中にある。これまでAIといえばクラウド——巨大なデータセンターに設置されたGPUクラスタでモデルを動かし、API経由で結果を受け取るのが当たり前だった。ChatGPTにせよClaudeにせよ、Geminiにせよ、ユーザーの手元にあるのは「入力窓」と「出力表示」だけだった。 しかし、この構図が変わりつつある。スモール言語モデル(Small Language Model、SLM)と呼ばれる小型のAIモデルが急速に進化し、手元のデバイスで実用的なAI推論が可能になりつつあるのだ。 SLMとは何か。厳密な定義はないが、概ね10B(100億)パラメータ以下のモデルを指す。大規模言語モデル(LLM)が数百億から数千億パラメータを擁するのに対し、SLMは「小さくても賢い」を体現する存在だ。そして2026年のSLMは、一昨年のLLMに匹敵する性能を発揮するようになっている。 なぜ2026年が「エッジAI元年」と言えるのか。理由は三つある。 第一に、モデルの小型化と高性能化が同時に進んでいること。Alibaba CloudのQwen3
5 min read