GUIDES / CONFIDENCE AS A MEASUREMENT

AIの確信を、
会話の流れから測る。

AIが「自信があります」と言ったかではなく、その数値が正答率と結びついているか。確信を計器として扱うための研究解説と、小さな監査ツールをまとめています。

更新: 2026.09.04方針: 一次情報・再現可能性・限界の明示

このガイドの読み方

確信度は、回答に添えられたパーセント表示だけでは評価できません。どのターンの発言なのか、何を根拠に上がったのか、結果として正しかったのかを同じログ上で突き合わせる必要があります。

00 / FUTURE LENS

AIは本当に理解しているのか

「理解」を一つの印象で決めず、未見課題への一般化、因果推論、grounding、説明のfaithfulness、較正へ分解します。2024–2026年の研究とFuture Lensで、判断の射程を監査します。

01 / 研究解説

マルチターン較正

会話が進むほど確信は上がるべきなのか。ACL 2026の研究をもとに、ターンごとの較正・情報の蓄積・会話の水増しを区別します。

02 / 既存特集

論文と研究の地図

較正、セマンティックエントロピー、自己整合性、棄権など、確信を測る方法の全体像は特集トップの研究アーカイブからたどれます。

03 / 監査ツール

ECE計算機

確信と正答率の差をビン単位で確認できます。実運用では、モデル・タスク・バージョンを分けた検証ログを使ってください。

04 / 指標の選び方

ECE・Brier・信頼性図

較正、識別力、確率予測の採点、評価分布が変わった後の再検証、API・内部信号・訓練データで変わる確信度推定を分ける方法。ブラウザ内の簡易監査も付いています。

05 / 独立ツール

信頼性図を描く

confidence・正解ラベル・任意のgroup(タスク、モデル版、evidence statusなど)・split(calibration、selection、testなど)を貼り付け、bin方式、層別ECE、固定thresholdのcoverage・selective risk、AUGRCを同じデータで比較します。根拠の状態と正解ラベルは分けて記録し、入力はブラウザ内だけで処理します。ステップごとの確信変化はagent軌跡監査ツールで分けて見ます。

07 / 推論モデル

reasoningの確信度

推論前後の確信、過信、反証への更新を、ACL・NeurIPS・Natureの一次研究と簡易監査で比較します。

08 / RAGルーティング

答える・再検索・棄権

KBの範囲、evidence status、claimの正しさ、拒否判断を分け、RAGの次の行動を一次研究と簡易監査で整理します。

09 / claim単位の較正

長文の確信を分解する

回答全体の確信、意味の不確実性、claim-level calibration、selective generationを分け、長文の混在誤りを簡易監査します。RAGでは根拠への支持を正しさと混同しません。

10 / AGENT UQ

AIエージェントの不確実性

task・action・tool・evidence・trajectory・clarification・handoffを分け、ACL 2026の研究とブラウザ内の軌跡監査へつなぎます。

読むときの3つの原則

CALIBRATION

数字と結果を分けない

0.8という確信は、同じ条件の回答を100件集めたときに約80件が正しい、という意味で初めて監査できます。

EVIDENCE

情報と会話量を分ける

新しい事実が追加されたのか、同じ内容が言い換えられただけなのかを記録します。長い文脈は証拠と同義ではありません。

LIMITS

研究の範囲を広げすぎない

特定のモデル、データセット、指標で得た結果を、すべてのLLMやすべての業務に一般化しません。

EDITORIAL NOTE

構造化データはページの内容を説明する補助です。検索結果への表示を保証するものではないため、本文の独自性・読みやすさ・参照可能な一次情報を先に整えています。