RAG

A collection of 3 posts
AI・テクノロジー

LLMは外部コンテキストを信用する時代へ — Selective Context TrustとSCOPE実践ガイド

はじめに 近年、外部信号や retrieved context を活用して回答の正確性を高める試みが広がっている。しかし、信号の出所が不確実だったり、信号自体に偏りがあると、正答から外れた結論に誘導されるリスクも同時に高まる。本稿では、信頼できる情報だけを選択的に取り込み、必要に応じて不確かな情報を補正する考え方として「Selective Context Trust」を提案する。これにより、過剰な信号依存を避けつつ、実運用での利便性と信頼性の両立を目指す。 SCOPE などの実践的アプローチでは、複数条件を同時に満たすよう設計することが重要である。主要な指標として MIST(誤導信号が全体の影響を評価するベンチマーク)と SC2W(誤解を招く信号が正解を覆す頻度を測る指標)を紹介する。さらに、DPO(Direct Preference Optimization)を活用して、4条件を等しくバランスさせた最適化の考え方を説明する。文脈選択の適切さは、AIの信頼性と利便性を両立させる鍵であり、設計の初期段階から検討しておくべきテーマである。 実務の視点では、ローカルLLM運用者やRAG
6 min read
AI・テクノロジー

SQLite-Vectorが切り拓くエッジAIのベクターサーチ:組み込みデータベースで実現するプライバシーファーストなセマンティック検索

はじめに — エッジAI時代のベクトル検索の課題 ChatGPTの登場以降、AIアプリケーションの風景は劇的に変化しました。中でもRAG(Retrieval-Augmented Generation)は、LLMのハルシネーションを抑制し、最新情報を反映するための事実上の標準アーキテクチャとなっています。そしてRAGの心臓部を担うのが、テキストの意味的近さを高速に計算するベクトル検索です。 クラウド型ベクターデータベースの成功と限界 Pinecone、Weaviate、Qdrant——これらのマネージドベクターデータベースは、百万規模のベクトルをクラウド上で管理し、ミリ秒レベルの類似性検索を実現してきました。しかし、すべてのユースケースがクラウドに適しているわけではありません。 遅延とコストが最初の壁です。モバイルアプリやIoTデバイスからクラウドへクエリを投げる場合、ネットワークラウンドトリップが致命的な遅延を生みます。より深刻なのはプライバシーの問題です。医療、法務、金融の領域では、ユーザーの機密データを外部サーバーに送信すること自体が法律で禁止されています。GDPRやCC
15 min read
AI・テクノロジー

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

はじめに AIエージェントは近年、推論能力だけでなく、思考の文脈をどう保持し活用するかという問題に直面しています。会話履歴やツール定義、ツールの出力といった文脈が増えると、メモリの消費が膨れ上がり、トークンコストの二次関数的な上昇を招きます。結果として、長い対話の中で必要な情報を正しく思い出すリコール精度が低下することがあります。 この課題を単なる保存・検索の問題として捉えるのではなく、ライフサイクルとアーキテクチャの問題として捉え直す新しい設計思想が求められています。Agentic Context Management、略して ACM はこの領域を整理する枠組みで、思考の文脈をどう覚え、どう忘れ、どう取り出すかを体系化します。5つのプリミティブ(設計・取り込み・スコープ・予測・圧縮統合)を軸に、コストと忠実度のトレードオフを実践的に解決する道を提案します。家庭用サーバー等の限られた環境でも効果が見込める設計であり、本記事ではその全体像と実践的な適用方法を解説します。 ACMの5つのプリミティブ AIエージェントの思考履歴をどう選別・格納するかは設計の核心です。ACMはメモリ
5 min read