このガイドの読み方
確信度は、回答に添えられたパーセント表示だけでは評価できません。どのターンの発言なのか、何を根拠に上がったのか、結果として正しかったのかを同じログ上で突き合わせる必要があります。
00 / FUTURE LENS
AIは本当に理解しているのか
「理解」を一つの印象で決めず、未見課題への一般化、因果推論、grounding、説明のfaithfulness、較正へ分解します。2024–2026年の研究とFuture Lensで、判断の射程を監査します。
01 / 研究解説
マルチターン較正
会話が進むほど確信は上がるべきなのか。ACL 2026の研究をもとに、ターンごとの較正・情報の蓄積・会話の水増しを区別します。
02 / 既存特集
論文と研究の地図
較正、セマンティックエントロピー、自己整合性、棄権など、確信を測る方法の全体像は特集トップの研究アーカイブからたどれます。
03 / 監査ツール
ECE計算機
確信と正答率の差をビン単位で確認できます。実運用では、モデル・タスク・バージョンを分けた検証ログを使ってください。
04 / 指標の選び方
ECE・Brier・信頼性図
較正、識別力、確率予測の採点、評価分布が変わった後の再検証、API・内部信号・訓練データで変わる確信度推定を分ける方法。ブラウザ内の簡易監査も付いています。
05 / 独立ツール
信頼性図を描く
confidence・正解ラベル・任意のgroup(タスク、モデル版、evidence statusなど)・split(calibration、selection、testなど)を貼り付け、bin方式、層別ECE、固定thresholdのcoverage・selective risk、AUGRCを同じデータで比較します。根拠の状態と正解ラベルは分けて記録し、入力はブラウザ内だけで処理します。ステップごとの確信変化はagent軌跡監査ツールで分けて見ます。
06 / 棄権と移譲
risk–coverage
低確信の回答を棄権し、答える範囲と正答率を設計する選択的予測。トップ特集のシミュレーターでしきい値の価格を試し、較正と人間移譲、prompt適応conformalの違いも確認できます。
07 / 推論モデル
reasoningの確信度
推論前後の確信、過信、反証への更新を、ACL・NeurIPS・Natureの一次研究と簡易監査で比較します。
08 / RAGルーティング
答える・再検索・棄権
KBの範囲、evidence status、claimの正しさ、拒否判断を分け、RAGの次の行動を一次研究と簡易監査で整理します。
09 / claim単位の較正
長文の確信を分解する
回答全体の確信、意味の不確実性、claim-level calibration、selective generationを分け、長文の混在誤りを簡易監査します。RAGでは根拠への支持を正しさと混同しません。
10 / AGENT UQ
AIエージェントの不確実性
task・action・tool・evidence・trajectory・clarification・handoffを分け、ACL 2026の研究とブラウザ内の軌跡監査へつなぎます。