先に結論
RAGは、検索を足せば自動的に「答えてよい」システムになるわけではありません。 KBの外から来た質問、近いが足りない根拠、部分的にしか支持されない回答、誤った拒否を別々に監査します。
運用上の出力は、回答/追加検索/claim検証/人間確認・棄権の少なくとも4つに分けると、どの不確実性に反応したのかを記録できます。
SCOPE
このKBの範囲か
質問が知識ベースの対象領域に入っているか。OODなら、関連語を含む文書が取れても根拠にはなりません。
EVIDENCE
根拠が足りるか
検索類似度ではなく、必要な前提・主体・時点・条件が根拠集合にそろっているかを確認します。
ACTION
次の行動を選べるか
不確実性が高いとき、無理に答えず再検索・外部補完・claim検証・人間確認へ分岐できるかを測ります。
1. 検索スコアと回答可能性を分ける
RAGのパイプラインでは、質問がKBの範囲にあるか、検索されたチャンクが必要な証拠を含むか、生成された回答がその証拠から言える範囲にあるかが順番に変わります。上流の類似度を、下流の真偽や回答可能性の代理にしないことが出発点です。
| 層 | 問い | 観測例 | 失敗時のルート |
|---|---|---|---|
| KB scope | 質問はこのKBの対象か | KB埋め込み空間との距離、ドメイン、時点 | 対象外なら外部検索・質問の明確化 |
| Retrieval | 回答に必要な根拠が取れたか | 根拠の被覆、主体・条件・鮮度、文書間の整合 | 再検索・検索範囲変更・資料追加 |
| Generation | 回答は根拠から言えるか | claim/factごとの支持・矛盾・未検証 | 再生成・claim検証・限定表現 |
| Decision | この回答を返してよいか | 拒否の適合性、残余risk、確認コスト | 人間確認・棄権・保留 |
Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG
Triantafyllopoulos et al. は、RAGのKBに対するout-of-domain(OOD)質問を、常時動かせる軽量なゲートとして扱います。16ドメインで、KB埋め込みの低次元部分空間と軽量分類器を比較し、プロンプトベースのLLM judgeより高速・低コスト・解釈しやすい検出器を検討しています。
ここで測っているのは「質問がKBの範囲か」であり、回答の真偽や引用の十分性そのものではありません。OOD検出を通過しても、生成後のclaim支持と拒否適合性は別に残ります。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗対話型AIにおける知識ギャップ検出と補完の自律制御
阿部・佐藤・村越・林は、企業内RAGで、検索が成功して見えても前提や事実が欠落する「知識ギャップ」を、内部知識不足と外部知識不足に分け、補完先を選ぶ中間レイヤを提案しています。Structured RAG Filter、多角的信頼度、階層的な補完誘導を組み合わせ、AIITの216問で評価しました。
資料の報告では、内部知識不足の判定がLLM判断の53–74%から提案手法の95–96%へ改善した一方、外部知識不足の判定は比較手法96%に対して87%でした。単一組織・216問・自動評価に依存する研究会資料であり、一般のRAGへの保証ではありません。
J-STAGE PDFで方法・条件・限界を確認する ↗2. 回答ではなく、claim / fact単位で見る
一つの回答に正しい文と未支持の文が混ざると、回答全体の「信頼度」だけでは、どこを直すべきか分かりません。claimを分割し、各主張が根拠に支持されるか、矛盾するか、判定不能かを残すと、限定・再生成・人間確認の対象を狭められます。
| 粒度 | 見えるもの | 見落としやすいもの | 運用での使い道 |
|---|---|---|---|
| 回答全体 | 大まかな正答・拒否率 | 一部だけ unsupported な複合回答 | 全体の基準線 |
| 文・sentence | 文ごとの幻覚傾向 | 一文に複数の主体・条件・数値 | 再確認箇所の絞り込み |
| claim / fact | 主語・関係・対象ごとの支持 | 分割ルールや検証器の誤り | 引用付与、部分修正、棄権 |
FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs
Sawczyn et al. は、複数サンプルの事実的一貫性を、knowledge graphの三つ組(head–relation–tail)へ落とし、外部リソースや学習データを必要としないfact-level検出を提案しました。要旨では、fact-level補正でfactual contentがベースライン比35.5%増加し、sentence-level SelfCheckGPTは10.6%だったと報告しています。
この数値はFavaMultiSamples等の研究条件における補正結果です。三つ組への分解、複数生成、評価用サンプルの質が変われば値も変わるため、「fact-levelなら必ず真偽が分かる」とは読みません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation
Hou et al. のBTPropは、初期主張から論理的に関係するclaimを再帰的に展開し、主張間の関係とLLMのfactuality判断をhidden Markov treeとして推論する枠組みです。要旨では、複数の幻覚検出ベンチマークでAUROCとAUC-PRを3–9%改善したと報告しています。
モデル自身のbelief判断もノイズを含むという前提を置く点が重要です。claimの関係を増やすほど検証コストや分解誤差も増えるため、短い回答の一つの確信値と同じものではありません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗A Head to Predict and a Head to Question: Pre-trained Uncertainty Quantification Heads for Hallucination Detection in LLM Outputs
Shelmanov et al. は、attention mapとlogitから情報を取る、事前学習済みのUQ headを提案しています。要旨では、Mistral・Llama・Gemma系列で、in-domainとout-of-domainのclaim-level hallucination detectionに強い結果と、未学習言語への一般化を報告しています。
これは内部表現へアクセスできるモデルを対象にした方法です。APIだけのRAG運用に、そのまま同じ信号があるとは限りません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗3. evidence statusと正しさを別列で残す
「検索された根拠がclaimを支持するか」と「そのclaimが外部の正解定義に照らして正しいか」は同じラベルではありません。前者はretrieved contextへのfaithfulness、後者はfactualityやtaskの正解です。根拠が支持していても資料自体が古い・誤っている場合があり、根拠が不足していても主張が偶然正しい場合があります。
| evidence status | 根拠集合の状態 | 次のルート | 記録の仕方 |
|---|---|---|---|
supported | 必要な条件・主体・時点が根拠から支持される | 回答候補。ただしfactualityと引用粒度を別確認 | group=supported、正しさは独立したoutcome |
insufficient | 関連はあるが、必要なhop・条件・被覆が足りない | 再検索・資料追加・claim検証 | group=insufficient、支持不足を正解0へ自動変換しない |
refuted | 根拠がclaimと矛盾する、または反証を含む | 回答停止・反証の解決・人間確認 | group=refuted、矛盾とfactuality判定を残す |
信頼性図ツールへ渡すときは、confidence=監査した確信信号、outcome=独立に判定した正しさ、group=evidence status、split=calibration・selection・testの役割として保存します。例えば 0.82,1,supported,test のように入力できます。KB scopeのOODはevidence statusとは別の軸なので、同じgroup列で混ぜる前に集計目的を決めてください。
信頼性図・ECE計算機の根拠status合成例 ↗ は説明用であり、実際のretrieverやverifierの出力を再現しません。
Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval-Augmented Generation
Fadeeva et al. のFRANQは、RAG出力について、retrieved contextへのfaithfulnessと外部のfactualityを混同しないよう、faithfulnessを条件にした不確実性推定を分けています。本文では、これをそのまま実装したとは扱わず、「根拠の状態」と「正しさ」を別列で評価する設計根拠として使います。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Why Uncertainty Estimation Methods Fall Short in RAG: An Axiomatic Analysis
Soudani et al. は、検索文書を入力に加えるRAGでは既存の不確実性推定が回答の正しさを安定して推定できないという問題を、5つの制約で分析しました。文脈を加えたときの信号の変化を確かめ、検索前の確信をそのまま回答の確信として扱わないための注意として参照します。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation
Qiu・Han・HuangのSURE-RAGは、passageの関連性と証拠の十分性を分け、回答単位のevidenceをSupported / Refuted / Insufficientの3値で検証する設計を提案しています。HotpotQA-RAGの制御評価とHaluBenchの境界実験を含むpreprintであり、ここでの3値を一般的な真実ラベルや本番保証へ広げません。
arXivで要旨・版・条件を確認する ↗4. 拒否は「しきい値」ではなく能力として測る
低いスコアを機械的に棄権させるだけでは、答えるべき質問まで拒否する過剰拒否と、根拠が壊れているのに答える過少拒否を区別できません。拒否の正しさを、KBの状態・文書の壊れ方・質問の種類を操作した評価で測ります。
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
Muhamed et al. は、RAGの文脈が不完全・矛盾・無関係になる条件を、176種類の制御された言語的摂動で生成するRefusalBenchを提案しました。要旨では、30超のモデルで、拒否には「拒否すべきか」と「何が問題かを分類するか」という別の能力があり、規模や長いreasoningだけでは改善しなかったと報告しています。
マルチドキュメント課題では拒否正解率が50%未満だったという報告も、同ベンチマークの設定に限定した結果です。RAGの「回答率を下げる」だけで安全性が上がるとは扱いません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗「検索結果あり」は回答許可、「類似度が低い」は棄権、という二値ルールにしない。 範囲・根拠・主張・拒否を別列で保存し、どの段階で次の行動へ移ったかをログに残します。
5. RAGの答える/再検索/検証を同じ表で監査する
4つのスコアを説明用に入力し、最初に詰まった層をルートへ変換します。スコアの定義やしきい値は研究論文の実装ではなく、評価設計を考えるための仮ルールです。
RAGルーティング簡易監査
scopeはKB範囲、evidenceは根拠の十分性、supportは回答claimの支持、confidenceはモデルの申告値です。いずれも0–1の説明用入力で、検索類似度や真実確率を直接表しません。
| ケース | KB範囲 | 根拠 | claim支持 | 確信 | 推奨ルート |
|---|
「回答可」は本番での安全保証ではありません。実際には、ドメイン、リスク、引用の粒度、データ鮮度、ヒューマンレビューの容量、モデル更新を含めて閾値を校正してください。
6. 実装・評価の順番
- KBの範囲を先に測る。 OODや質問の内部/外部志向性を、検索後の回答品質と混ぜずに記録する。
- 検索成功と証拠十分を分ける。 類似度、被覆、主体、条件、鮮度、文書間の矛盾を別の列にする。
- 回答をclaimへ分解する。 一文に複数の主張がある場合、引用・支持・矛盾・判定不能をclaim単位で残す。
- 拒否を陽性・陰性の両方で評価する。 根拠が壊れた質問を拒否できるかだけでなく、根拠がある質問を過剰拒否しないかも測る。
- ルート別のコストを記録する。 再検索、外部検索、再生成、claim検証、人間確認の遅延・費用・残余riskをcoverageと並べる。
- モデル内部信号の利用可能性を書く。 hidden state・logit・複数サンプルが必要な手法と、API出力だけで動く手法を同格にしない。
このページの監査は、実際のretriever、LLM、KB、引用、claim verifierへ接続していません。入力したスコアから説明用のルートを出すだけで、ハルシネーション率や安全性を推定するものではありません。
参照した一次情報
- Triantafyllopoulos et al. (2026), Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG, ACL 2026. ACL Anthology ↗
- Muhamed et al. (2026), RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models, EACL 2026. ACL Anthology ↗
- Sawczyn et al. (2026), FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs, Findings of EACL 2026. ACL Anthology ↗
- Hou et al. (2025), A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation, NAACL 2025. ACL Anthology ↗
- Shelmanov et al. (2025), A Head to Predict and a Head to Question, EMNLP 2025. ACL Anthology ↗
- 阿部雄大・佐藤里恵・村越英樹・林久志 (2026), 対話型AIにおける知識ギャップ検出と補完の自律制御, 人工知能学会第二種研究会資料. J-STAGE PDF ↗
- Fadeeva et al. (2026), Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval-Augmented Generation, Findings of ACL 2026. ACL Anthology ↗
- Soudani et al. (2025), Why Uncertainty Estimation Methods Fall Short in RAG: An Axiomatic Analysis, Findings of ACL 2025. ACL Anthology ↗
- Qiu・Han・Huang (2026), SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation, arXiv preprint. arXiv ↗
書誌情報・研究ステータスは2026-09-04にACL Anthology、J-STAGE、arXiv、各論文アーカイブで再確認しました。数値は各研究のモデル・データ・評価条件に限定し、preprintを査読済み研究と同格に扱っていません。