この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • グラフ構造を利用するGraphRAGは、全体を俯瞰する質問で有意に高い性能を示す
  • マルチホップQAではRecall@5が73.4%から87.8%に向上
  • インデックス構築にLLMを多用するため、処理コストが高くなる

ベクトルRAGの限界

従来のRAG(検索拡張生成)では、文書を小さなチャンクに分割し、それぞれを埋め込みベクトルに変換してインデックスを作成する。クエリが来ると、類似度の高いチャンクを上位k件取得し、そのままモデルに渡して回答を生成する。この方式は「Q3の返金ポリシーは?」のような局所的な質問には強い。しかし「2年間のカスタマー不満の共通テーマ」のような、文書全体を横断する質問では、1つのチャンクに答えが入っていないため、うまく機能しない。

この構造的な欠陥として、記事は三つの点を挙げている。一つは、異なるチャンクにまたがる情報を関連付けることができない点。もう一つは、全体を俯瞰する質問に対して類似検索では表面的に似たチャンクしか返せない点。そして、チャンクの境界で文脈が切断され、複雑な推論に必要な関係性が失われる点である。Microsoft Researchもこの問題を認識しており、ベースラインのRAGは「点と点を結ぶのに苦労する」と指摘している。

GraphRAGの仕組み

GraphRAGは、質問が来る前のインデックス構築段階で、LLMを使ってテキストからエンティティ(実体)と関係性を抽出し、重み付き知識グラフを構築する。さらに、Leidenアルゴリズムによるコミュニティ検出を行い、関連するトピックの階層構造を作り、各コミュニティに自然言語の要約を事前作成する。これにより、質問時に孤立したチャンクではなく、構造化された文脈をモデルに提供できる。

クエリ時には、関連するコミュニティの要約を基に部分回答を生成し(マップ)、それらをランク付けして統合する(リデュース)という手順を踏む。最終的な回答は、いくつかの断片ではなく、グラフ構造に基づいて合成される。HippoRAGというバリアントは、グラフとPersonalized PageRankを使って関連する文章を見つけるが、アイデアは同じで、コサイン類似度だけでなく関係性に基づいて文脈を決定する点が特徴だ。

エビデンスが示す性能差

Microsoftが行った比較実験では、100万トークン規模のデータセットを使い、RAGとGraphRAGを全体を把握するタイプの質問で比較した。LLMを判定役として、網羅性、多様性、エンパワーメント(活用しやすさ)の3軸で評価したところ、GraphRAGはベクトルRAGに対して、網羅性で72〜83%、多様性で62〜82%の比較で勝った。また、最上位の要約はソーステキストを直接処理する場合と比べて最大97%少ないトークンで済んだ。

さらに、マルチホップQAの標準ベンチマーク(MuSiQue、HotpotQA、2WikiMultiHopQA)で、正解に関連する文章が上位5件に入るRecall@5を比較すると、素のRAGの73.4%に対して、グラフ誘導のRAGは87.8%に向上した。この+19.6ポイントという改善は、“チャンクの限界”をグラフが補っている証拠と言える。

適用判断と注意点

ただし、GraphRAGにはコストが伴う。インデックス構築でLLMを大量に使うため、処理時間と計算コストがベクトルRAGよりもはるかに高くなる。記事は「無料で手に入るわけではない」と述べており、常にGraphRAGを使うべきではないとしている。

具体的には、単一の事実に基づく質問や、チャンクに答えが含まれる場合は従来のRAGで十分だ。一方、全体を横断する分析や、複数の文書にわたる推論が必要な質問では、GraphRAGの効果が期待できる。どのタイプの質問が業務で多いかを把握し、コストと精度のトレードオフを考慮して選ぶことが重要だろう。

原文からの引用
Baseline RAG “struggles to connect the dots” and performs poorly when asked to “holistically understand summarized semantic concepts over large data collections.”

ベースラインのRAGは「点と点を結ぶことに苦労し」、大規模なデータコレクションにわたる意味的な概念を総合的に理解するよう求められた場合には性能が低い。

日本の開発者・IT企業にとっての意味

日本のIT企業が社内文書検索や顧客サポートのFAQシステムを構築する際、RAGの方式選びは精度と運用コストに直結する。GraphRAGは全体俯瞰型の質問で高い性能を示す一方、インデックス構築にLLMを多用するため、初期コストとランニングコストが大きい。そのため、導入前に扱う質問の種類を分析し、既存のベクトルRAGで不足するケースを洗い出すプロセスが重要になる。また、オープンソースの実装を利用して自社データで評価し、費用対効果を検証することを推奨したい。Microsoftの論文やHippoRAGの実装は、その判断材料として有用である。

用語解説

GraphRAG
文章から抽出したエンティティと関係性をグラフ構造で表現し、その構造を文脈として利用するRAGの手法。
ベクトルRAG
文書をチャンクに分割し、埋め込みベクトルの類似度で関連文書を検索してモデルに渡す従来のRAG。
マルチホップQA
複数の文書にまたがる情報を組み合わせて答えを導く必要がある質問応答タスク。
Recall@5
検索結果の上位5件に正解を含む割合。高いほど検索精度が良い。
Leidenアルゴリズム
グラフをコミュニティ(密につながった部分)に分割するためのアルゴリズム。

出典

Stop graphing everything: When GraphRAG actually beats vector RAG

VentureBeat / dattarajraogravitar@gmail.com (Dattaraj Rao, Persistent Systems) / 2026年8月3日

https://venturebeat.com/orchestration/stop-graphing-everything-when-graphrag-actually-beats-vector-rag

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する