はじめに — エッジAI時代のベクトル検索の課題
ChatGPTの登場以降、AIアプリケーションの風景は劇的に変化しました。中でもRAG(Retrieval-Augmented Generation)は、LLMのハルシネーションを抑制し、最新情報を反映するための事実上の標準アーキテクチャとなっています。そしてRAGの心臓部を担うのが、テキストの意味的近さを高速に計算するベクトル検索です。
クラウド型ベクターデータベースの成功と限界
Pinecone、Weaviate、Qdrant——これらのマネージドベクターデータベースは、百万規模のベクトルをクラウド上で管理し、ミリ秒レベルの類似性検索を実現してきました。しかし、すべてのユースケースがクラウドに適しているわけではありません。
遅延とコストが最初の壁です。モバイルアプリやIoTデバイスからクラウドへクエリを投げる場合、ネットワークラウンドトリップが致命的な遅延を生みます。より深刻なのはプライバシーの問題です。医療、法務、金融の領域では、ユーザーの機密データを外部サーバーに送信すること自体が法律で禁止されています。GDPRやCC