先に結論
較正とは、予測確率が実際の正しさの確率を表すこと。 ただし、ECEだけを小さくしても、モデルが正しい・役に立つ・誤りを見分けられる、とは限りません。
まず目的を分けます。確信と頻度のズレを見るならECEと信頼性図、確率予測全体を採点するならBrier scoreやlog loss、正誤を確信の順番で分けられるかを見るならAUROC、誤った高確率を強く罰するならNLLです。
CALIBRATION
数字と頻度が合うか
0.8と出した回答を同じ条件で100件集め、約80件が正しいかを見る。ECEはそのズレをビンで要約する。
DISCRIMINATION
正解を上位に置けるか
正しい回答に高いスコア、誤った回答に低いスコアを付けられるか。AUROCはこの順位づけを測るが、確率の意味までは保証しない。
SHARPNESS
曖昧なまま逃げないか
全部を0.5と予測すれば、平均的には較正されても情報量がありません。Brier scoreは正しさと確率の鋭さを合わせて採点します。
1. 較正・正確さ・識別力を分ける
現代のニューラルネットワークの較正を代表的に検証した研究の一つがGuo et al. (ICML 2017)です。同研究はニューラルネットが高い正解率を持ちながら、確率としてはうまく較正されていない場合を調べ、温度スケーリングという後処理を評価しました。
ここから重要な区別が生まれます。正確さは答えが当たった割合、識別力は正しい例を誤った例より上位に置く力、較正は確率の値が実際の頻度と合うかです。ひとつが良くても、他が良いとは限りません。
| 見たい問い | 第一候補 | 一緒に報告するもの | 読み違えやすい点 |
|---|---|---|---|
| 確信0.8は本当に8割か | 信頼性図 + ECE | ビンごとの件数、信頼区間、MCE | ビン分割で値が変わる。ECEの小ささだけで「良い確信」と決めない。 |
| 確率予測全体を採点したい | Brier score | 基準率、Brier decomposition、accuracy | 値の大小はタスクの基準率や符号化と一緒に読む。 |
| 誤答を先に人へ回したい | 固定点: risk-coverage / 方法比較: AUGRC | 棄権率、選択時の正答率、閾値、失敗かつ受理の総量 | 順位が良くても、0.9が本当に90%とは限らない。 |
| 極端な誤信頼を罰したい | log loss / NLL | 確率のクリップ規則、外れ値、Brier | 誤答に0や1を付けると値が極端になる。数値安定化を明記する。 |
ここでのECEは、確信を複数の区間(bin)に分ける代表的な実装です。bin数、等幅か分位点か、空binの扱い、サンプル数は結果の解釈に影響します。比較時は実装条件を固定してください。
2. Brier scoreは何を足してくれるか
Brier scoreは、確率予測と実現した結果(0/1)の二乗誤差を平均します。確率を正解に近づけるほど小さくなり、正解に0.51を出すより0.90を出すことの価値も、外したときの痛みも反映します。
一方、ECEは「ビン内の平均確信と正答率の差」を見るため、個々の予測がどれほど鋭かったかを直接採点しません。極端に言えば、すべてを0.5と出して正答率が50%なら、粗いビンではECEが0になる可能性があります。それでも、どの例が危ないかを区別できず、棄権や人間へのルーティングには役立ちません。
ECEは「平均的な計器のズレ」、Brier scoreは「各予測に対する採点」。どちらか一方を信頼性の総合点にしない。
Verification of Forecasts Expressed in Terms of Probability
Glenn W. Brierが1950年に発表した確率予報の検証論文です。Brier scoreの名前だけをLLM固有の指標として扱わず、確率予報・予測の採点という長い文脈の上に置くための原典として参照します。
American Meteorological Societyで書誌情報を確認する ↗3. Brier・ECE・信頼性図を同じデータで見る
下の入力は、6件の二値予測を使った小さな監査です。確率 p と結果 y を変えると、Brier score、5ビンのECE、最大ビン誤差、信頼性図が同時に更新されます。数値は説明用であり、モデル評価のサンプルサイズを満たしません。
確率予測ミニ監査
Brierは小さいほど良く、ECE/MCEも小さいほどビン平均のズレが小さい。信頼性図の破線は理想的な45度線です。
| ケース | 確率 p | 結果 y | 寄与 (p−y)² |
|---|
「全件0.5」プリセットでは、結果の構成がちょうど半分ならECEが0になる一方、Brierは0.25で、予測はどの例も区別していません。これはECEが間違っているという話ではなく、一つの集約値が答えられる問いに限界があるという話です。
4. ECEの限界とLLMでの注意
ECEは便利ですが、推定量としての弱点があります。binの境界を変えると値が変わり、少数データではビン内の正答率が不安定になり、異なるデータ分布で平均すると問題のあるサブグループが隠れます。MCEは最大のズレを拾いますが、1つの小さなbinに大きく反応します。
LLMではさらに、何を確率の単位にしたかが重要です。選択肢問題のtop-1確率、回答全体のverbalized confidence、token probability、意味クラスタの頻度は同じ量ではありません。Full-ECEは、語彙が大きく分布全体を扱うLLMのtoken-level calibrationに対して、従来のECEやclasswise-ECEとは異なる全分布の較正を提案したpreprintです。分類タスクの5-bin ECEと置き換えるのではなく、対象が違う指標として読みます。
評価レポートには、少なくとも「正答率」「BrierまたはNLL」「ECEとbin条件」「信頼性図」「固定運用点のrisk-coverageまたは複数thresholdのAUGRC」「データ分割・モデル条件」を並べる。確信を表示する本番システムでは、モデル更新・タスク・顧客属性・難易度の層別も確認する。
少数例のaccuracyや固定threshold coverageは、点推定だけでなく二項比率の区間も併記します。信頼性図ツールでは、binごとのaccuracy、group・split・thresholdごとのaccuracy/coverageにWilson 95%区間を表示しますが、これは固定した条件での区間です。ECE全体の区間ではなく、thresholdを同じデータで選んだ不確実性、依存した行、モデルや分布の不確実性も含みません。Arrieta-Ibarra et al. はbin幅と統計的信頼性・解像度のトレードオフを整理し、Sun et al. のpreprintは別定義のℓ2 ECEに対する区間推定を扱っています。
較正map・threshold選択・最終評価のデータを分ける
temperature scaling、isotonic regression、その他のcalibration mapや棄権thresholdは、正解ラベルを見て選ぶ調整です。調整候補を見比べた行を、そのまま最終ECE・risk-coverage・AUGRCの報告にも使うと、数値は「未知のholdoutで一度だけ測った値」ではなく、選択に使ったデータ上の値になります。直ちにすべてが無効になるという意味ではありませんが、最終評価としての解釈が変わるため、役割と選択履歴を記録します。
| データの役割 | ここで決めること | 最終評価への扱い |
|---|---|---|
| train / model fit | モデルの重み・プロンプト・推論器 | 最終指標の報告用には使わない。 |
| calibration set | temperature scalingやconfidence mapの係数 | mapを学んだ後、同じ行を最終性能の主張に使わない。 |
| selection / validation | map、bin条件、threshold、モデル版の候補比較 | 候補を選んだら、最終testへ選択を持ち込まない。 |
| final test / holdout | 原則として決めない。accuracy、Brier、ECE、risk-coverage、AUGRCを報告する | 選択終了後に一度だけ読む、未調整の評価面。 |
| post-deploy labeled sample | 時間・利用者・地域・モデル更新後の再検証 | 過去testの再利用ではなく、shift後の別評価として記録する。 |
Kängsepp et al. は、ECEをtestデータ上で関数族を当てはめる視点から読み直し、bin選択やcross-validation tuningを含む評価設計を論じた査読済み研究です。これは「同じデータなら必ず一定方向に偏る」という定理としてではなく、評価指標やbin条件がデータを見て選ばれていないかを点検する警告として使います。Jiang et al. のTACL研究も、LLMの較正をモデル・QAデータセット・post-hoc手法の条件付きで比較しており、単一の較正値をモデル一般へ移さない読み方を補強します。
On the Usefulness of the Fit-on-the-Test View on Evaluating Calibration of Classifiers
較正mapを直接学ばないECEでも、binや評価関数の選び方をtest上の適合として捉えられる、という方法論上の視点を提示した査読済み研究です。これはLLMの本番性能を示す研究ではなく、評価設計の境界を点検するために参照します。
Machine Learningの書誌情報を確認する ↗較正が合っていても、確率として一貫しているとは限らない
較正は「確信の値と正解頻度が合うか」を見る重要な軸ですが、それだけで確信が一貫した確率として解釈できるとは限りません。Matta et al. は、LLMのconfidenceをstructural coherence・faithfulness・usefulnessの3軸で評価するC1 metricsを提案し、較正誤差が下がっても構造的な違反が残りうると論じています。
| 追加する軸 | 問い | 較正との違い | 運用での使い方 |
|---|---|---|---|
| structural coherence | 確信の順序や関係が、論理的な関係と矛盾しないか | 同じbin内の平均が合っていても、個別の関係性は見逃しうる | 論理的に易しい/難しい入力や関係のある入力を別に比較する |
| faithfulness | 確信が、測りたい対象の不確実性を実際に追っているか | 正解頻度との対応と、入力支持・知識支持への対応は同じではない | intrinsic/extrinsic hallucinationやRAGの根拠条件を分けて検証する |
| usefulness | 確信が、回答・棄権・人間移譲の判断に役立つか | 確率として整っていても、下流の効用やコストを保証しない | accuracyだけでなく、routing・待ち時間・確認コストを測る |
C1の軸はECEの代替となる単一総合点ではありません。各論文の定義、評価分布、ラベル、下流目的を固定し、較正・構造的一貫性・faithfulness・usefulnessを別々に報告します。
5. 評価分布が変わったら、較正を再検証する
較正は、ある評価分布の中で「このconfidence帯の正答率がどれくらいか」を測る性質です。モデル、system prompt、ツール、利用者、地域、季節、質問タイプが変われば、同じthresholdや温度スケーリングをそのまま持ち越せるとは限りません。過去の検証データでECEが小さかったことと、現在の入力でも信頼できることは別の主張です。
| 評価条件 | 変化の例 | ラベルがあるとき | ラベルがないとき |
|---|---|---|---|
| 同じ分布のholdout | 同じモデル版・タスク・利用条件 | accuracy、Brier、ECE、bin件数を基準線として記録する。 | 較正の合否は決めず、入力件数やconfidence分布を補助的に監視する。 |
| 時間・利用者・地域のshift | 月、顧客層、言語、地理、質問タイプが変わる | 全体だけでなくgroup別に同じ指標とcoverage-riskを再計算する。 | prompt分布や回答率の変化を検知し、ラベル付き評価を追加するまで較正劣化を断定しない。 |
| モデル版・system変更 | 重み、推論設定、ツール、RAG構成を更新する | 旧版と新版を同じ評価分割で比較し、threshold・calibration setを再固定する。 | 出力の分布差だけでaccuracyやECEを推定しない。 |
| OOD・未知領域 | 学習・検証時に想定しなかった入力 | 対象ラベルを定義し、通常の正答率とOOD検出・拒否の問いを分ける。 | 高confidenceを正しさの証拠とみなさず、再検索・確認・棄権へ回す。 |
既存の信頼性図ツールでは、3列目のgroupを`2026-08`、`model-v2`、`task-A`のような評価単位にし、4列目のsplitを`calibration`、`selection`、`test`のようにして、同じ入力形式から粗い差分を確認できます。ただし、group・split表は分布距離やシフトの因果効果を推定する検定ではありません。ラベルのない本番ログから、confidenceだけで「較正が崩れた」とは結論しないでください。
Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift
Ovadia et al. は、画像・テキスト・カテゴリの分類ベンチマークで、i.i.d.条件だけでなくdataset shift下のaccuracyとcalibrationを比較しました。要旨・本文の範囲では、i.i.d.検証で温度スケーリングが低いECEを示しても、shiftが強くなるとECEが上がり、i.i.d.での較正はshift下の較正を保証しません。
これは分類モデルの実験結果であり、任意のLLM・prompt・RAGへそのまま一般化するものではありません。ここで再利用する示唆は、評価分布を固定して記録し、変更後に同じ指標を再測定することです。
NeurIPSで要旨・書誌情報を確認する ↗Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance
Seegmiller & Preumは、自然なprompt分布の変化を時間・user group・地理の軸で測るLENS frameworkを提案しました。ACL Anthologyの要旨では、192のpost-deployment shift設定、81モデル、4.68Mのtraining prompts、57.6kの評価promptを用い、moderateなprompt変化とinstruction-following性能低下の関連を報告しています。
要旨の「73% average loss」は同研究のデータ・モデル・評価設計における報告値であり、すべてのLLMの性能低下率や因果効果ではありません。CONFIDENCEでは、時間・利用者・地域のgroupを分けて再評価するという実務上の入力設計に限定して参照します。
ACL Anthologyで要旨・PDF・書誌情報を確認する ↗BaseCal: Unsupervised Confidence Calibration via Base Model Signals
Tan et al. は、post-trained LLMが過信しやすい一方、対応するbase LLMの信号がより較正されている場合があるという観察から、追加のラベル付き較正データやfine-tuningを必要としないBaseCalを提案しています。BaseCal-ReEvalとBaseCal-Projという二つの構成を、5データセット・3 model familyで評価しています。
要旨の報告では、最良のunsupervised baselineに対して平均ECEを42.90%低減していますが、これは論文のモデル・データ・base/post-trainedペアと評価条件における結果です。外部APIの確信値や本番agentへ自動的に移せる一般保証ではありません。
ACL Anthologyで要旨・PDF・書誌情報を確認する ↗分布shiftの監視は、入力分布の変化を見つけることと、正解ラベル付きの較正劣化を測ることを分けて行います。前者だけで後者を推定したり、過去のcalibration setを現在の運用保証と呼んだりしません。group別の信頼性図ツールで評価単位を分ける ↗
6. 較正された確率でも、棄権方針は別問題
「確信0.8が約8割正しいか」は較正の問いです。一方、「どの回答をそのまま返し、どれを棄権・再検索・人間へ移譲するか」は選択的予測の問いになります。回答した割合をcoverage、回答を残した集合の誤り率をselective riskとして記録すると、確率の意味と運用上の境界を分けて評価できます。
しきい値を下げれば回答数は増えやすい一方、危険な回答が混ざる可能性があります。人間移譲では、残った回答のriskだけでなく、移譲率・待ち時間・確認コスト・誤りの重大さも下流の効用として定義します。したがって、ECEが小さいモデルを選ぶだけでは、棄権方針の良し悪しは決まりません。
| 方針 | 主に測る量 | 判断したいこと | 注意点 |
|---|---|---|---|
| 全件を回答 | overall accuracy / risk | 制約なしの基準線を作る | coverageは100%でも、難しい入力を見分けていない。 |
| 低確信を棄権 | coverage + selective risk | どの回答を残すと誤りが減るか | しきい値だけでなく、確信の順位づけと対象分布を固定する。 |
| 人間・再検索へ移譲 | 回答率・移譲率・残余risk・効用 | 誤りの重大さと確認コストを含めて運用できるか | モデル指標だけでなく、担当者の処理能力とSLAも評価対象になる。 |
固定の運用点と、複数thresholdの方法比較を分ける
「coverageを80%にして、残した回答の誤り率は何%か」は、特定の運用点を決める問いです。一方、confidence scoring functionやモデルを複数thresholdで比較するなら、固定点を一つ選ぶだけでは順位づけを取りこぼします。Traub et al. は、受理された集合の条件付き誤り率(selective risk)と、失敗かつ受理された同時確率(generalized risk)を分け、後者をcoverage全体で積分するAUGRCを提案しました。
| 評価の目的 | 読む量 | このサイトでの扱い | 言えないこと |
|---|---|---|---|
| 本番の一点を決める | 指定thresholdのcoverage・selective risk | 運用コスト、移譲率、許容riskと一緒に固定する。 | 一つのthresholdの結果だけで、別のthresholdや別モデルの総合順位は決めない。 |
| 方法を複数thresholdで比べる | AUGRC(失敗かつ受理のgeneralized risk) | 同じラベル付き評価データ・同じconfidence定義で、低い値を比較する。 | 較正、conformal guarantee、分布shiftへの頑健性、下流コストを自動的に保証しない。 |
| 確信の値自体を確率として読む | 信頼性図・ECE・Brier・NLL | 確率の意味と棄権性能を別の軸として併記する。 | AUGRCが低いだけで、0.9が90%正しいとは言わない。 |
複数thresholdの評価には、失敗の受理を数える
Traub et al. のAUGRCは、固定thresholdでのselective riskをそのまま平均するのではなく、失敗かつ受理された割合をgeneralized riskとして扱います。要旨では6データセット・13種類のconfidence scoring functionで、AUGRCが既存の複数threshold指標と異なる順位を生む例を報告しています。
CONFIDENCEのツールは、二値の`outcome`(1=正解、0=失敗)を使う経験的なAUGRCだけを表示します。論文の一般的なerror function、最適化、有限標本保証を実装したものではありません。
NeurIPSで要旨・書誌情報を確認する ↗CAP: Conformalized Abstention Policies for Context-Adaptive Risk Management for LLMs and VLMs
Tayebati et al. は、conformal prediction(CP)と深層強化学習を組み合わせ、入力ごとにconformal risk levelを選ぶ棄権方針CAPを提案しました。要旨の範囲では、point prediction・set prediction・full abstentionを下流効用に応じて選び、Policy-Calibrated Coverageという保証を導入しています。
論文の実験では、90%の目標coverageを維持しつつ、静的CPベースラインに対してhallucination detection AUROCを最大22.2%、selective generationのAUARCを21.2%改善し、calibration errorを70%以上低減したと報告されています。これは論文の実験条件における結果であり、任意のLLMや運用環境にそのまま移る保証ではありません。
PMLRで要旨・書誌情報・PDFを確認する ↗2026年の補足:promptごとのcoverageをどう扱うか
同じしきい値を全promptへ適用すると、簡単な質問と未知領域の質問で回答率・誤り率が混ざります。近年の研究は、入力ごとの難しさを校正へ入れる方向と、open-ended生成でconfidenceを棄権判断へ接続する方向を分けて提案しています。
| 方法 | 適応するもの | 要旨・論文での主な範囲 | 読み方 |
|---|---|---|---|
| 固定しきい値 | 全prompt共通のscore境界 | 回答率と残余riskを説明する基準線 | このUIの説明用thresholdだけでは、有限標本の保証を主張しない。 |
| CAP | 入力ごとのconformal risk level | Policy-Calibrated Coverageと下流効用を扱うACML 2025の査読済み研究 | 実験のモデル・評価条件に限定して読む。 |
| Adaptive CP | prompt依存のconformal score変換 | marginal coverageを保ちながらconditional coverage改善を狙い、long-form生成と選択問題を評価するpreprint | white-boxモデルと校正データの前提を残す。 |
| Geometry-calibrated CA | confidenceと表現空間のgeometry | open-ended生成のconfidence-based abstentionで、participationとcorrectnessの有限標本保証を提案するpreprint | 75% conditional correctnessは同研究の実験報告であり、普遍的な性能保証ではない。 |
Adaptive Conformal Prediction for Improving Factuality of Generations by Large Language Models
Rubashevskii et al. は、入力ごとの変動を扱うprompt-adaptiveなconformal predictionを提案し、要旨ではmarginal coverageの保証を保ちながらconditional coverageの改善を報告しています。long-form生成とmultiple-choice QAを対象にし、信頼できないclaimや選択肢を下流で除くselective predictionへ接続します。
査読前preprintであり、white-boxモデル、評価データ、conformal score、exchangeabilityなどの条件を外してAPI一般へ移植できるとは扱いません。
arXivで要旨・バージョンを確認する ↗Geometry-Calibrated Conformal Abstention for Language Models
Xu et al. は、open-ended生成でconformity scoreを直接扱いにくい問題に対し、confidenceを表現空間のgeometryで補正して棄権を決めるpost-hocのConformal Abstentionを提案しています。要旨ではparticipationとcorrectnessの有限標本保証、実験で75%のconditional correctnessを報告しています。
表現空間へのアクセスと研究固有の正解判定が必要です。これは査読前preprintの方法・実験範囲であり、任意のblack-box APIの棄権保証ではありません。
arXivで要旨・バージョンを確認する ↗CPのcoverage保証は、校正データ、exchangeability、score、正解ラベル、保証の単位に依存します。marginal coverageとconditional coverage、回答率、selective risk、AUGRCを同じ「coverage」や「較正」と呼ばないでください。このページの内蔵二値・5-bin監査はAUGRCを実装していません。複数thresholdの経験的なAUGRCは信頼性図ツールで確認できますが、CAPや新しいpreprintを実装したものではありません。
7. 確信の測り方は、アクセス権でも変わる
同じ「確信度推定」でも、観測できる情報が違えば答えられる問いが変わります。出力だけを受け取るAPI、token likelihoodや内部状態を読めるモデル、訓練データへアクセスできる実験環境を、同じベンチマークの数字として混ぜないことが重要です。
| アクセス条件 | 使える信号の例 | 主に評価できる問い | 境界 |
|---|---|---|---|
| 出力・APIのみ | 自己申告確信、複数サンプル、外部評価 | 回答の揺れや確信の順位で、誤りを見分けられるか | モデル内部の知識状態や生成過程を直接観測できない。 |
| 内部信号あり | token likelihood、hidden state、生成時の統計 | モデル側の信号を、正答・不正答へ較正できるか | token単位の値を回答全体の確率として扱うには、集約方法と評価データが要る。 |
| 訓練データへアクセス | 尤度 + 関連事例の有無や近さ | 学習時の関連情報が、確信度推定を補助するか | 通常のAPI運用とは異なり、データ構築・記憶・漏洩の条件を別に記録する。 |
訓練データを用いた言語モデル生成の確信度推定
吉川和・岡崎直観は、中規模の言語モデルと訓練データ全文のデータストアを使い、訓練データに基づく複数の確信度推定法を知識評価タスクで比較しました。抄録の範囲では、モデルの尤度と訓練データ中の関連事例の有無を組み合わせることで、訓練データを使わない条件より確信度推定の精度が改善しました。
これは訓練データへアクセスできる設定での査読研究です。一般的なAPI利用や、すべてのLLM・タスクに同じ改善が移ることを示す結果ではありません。訓練データに関連事例があることも、回答の正しさや出典を自動的に保証するものではありません。
J-STAGEで抄録・PDF・書誌情報を確認する ↗8. 研究から見える「平均の罠」
Mind the Gap: Specialty-Aware Clinical QA
Testoni & Calixtoは、臨床QAで10のオープンモデルと複数の質問タイプ・専門領域を評価し、信頼性を一つの性質として扱えないと報告しました。要旨では、較正と識別力のシフトが専門領域・質問タイプに依存し、モデル選択も用途に応じて行う必要があると整理されています。
ACL Anthologyで要旨・PDF・書誌情報を確認する ↗この研究を、すべての医療LLMに対する一般的な結論として引用しません。ここから得られる実装上の示唆は、全体平均のECEだけで運用可否を決めず、実際の業務単位で層別して指標を出すことです。記事の対象は医療に限定されませんが、用途ごとに確信の意味が変わることを具体的に示すケースとして扱っています。
Rethinking Uncertainty Evaluation in Large Language Models
Matta・Naphade・Zouは、較正だけでは一貫した確率的信念を検証できないとして、structural coherence・faithfulness・usefulnessをC1 metricsとして定式化しました。要旨では、論理的に易しい質問へ低い確信を付ける事例が31%あること、RMSCEを下げる介入後も構造的違反が残ること、RLHFとchain-of-thoughtがusefulnessを改善してもcoherenceを戻さないことを報告しています。
arXiv preprintで、コメント欄はICML 2026 EIML Workshopを示します。C1をサイトの単一合格点や任意APIの保証とは扱わず、確率の妥当性を較正の外側から監査する候補として紹介します。
arXivで要旨・本文・版を確認する ↗Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
Agnimo et al. は、情報理論・サンプリング・reflexive系の不確実性推定量を、hallucinationの直接代理と仮定せずに比較しました。要旨では、input faithfulnessを損なうintrinsic hallucinationと、学習知識に支持されないextrinsic hallucinationを分け、RAGTruth・HalluLensを含む4つのbenchmarkで関連の強さを評価しています。
不確実性とhallucinationの関連は、hallucinationの種類とLLMによって変動し、しばしば弱いと報告されています。これは「不確実性を使うな」という結論ではなく、検出したい失敗型ごとにestimatorと検証データを合わせるためのpreprintです。
arXivで要旨・本文・版を確認する ↗Full-ECE: A Metric For Token-level Calibration on Large Language Models
Liu et al. は、LLMの語彙規模・データの複雑さ・全確率分布を理由に、token-levelの較正では従来のECEやclasswise-ECEが不十分になりうると主張し、Full-ECEを提案しています。arXiv上のpreprintであるため、査読済みの確立事項と同じ強さで扱いません。
arXivで本文・バージョンを確認する ↗9. 較正監査のチェックリスト
- 確率の意味を固定する。 正解確率、回答全体の自己申告、token確率を同じ列に入れない。
- 評価データを分ける。 train、calibration map、候補・threshold選択、final testの役割を記録し、調整に使った行を最終評価の主張へ混ぜない。
- 保証の単位を分ける。 marginal coverage、conditional coverage、回答率、selective riskが、どのprompt集合・分割・ラベルに対する値かを記録する。
- bin条件を記録する。 bin数、等幅/分位点、空bin、重み、信頼区間をレポートに残す。
- 平均を分解する。 タスク、難易度、言語、モデル、質問タイプ、会話ターンなど、運用上意味のある層で確認する。
- 較正以外の合格条件を定義する。 structural coherence、faithfulness、usefulnessを別に測り、ECEが小さいことだけで確率の妥当性や下流の効用を合格にしない。
- 必要な信号を確認する。 white-boxのlogit・hidden state・表現空間を使う方法を、出力だけのAPIで使える方法と同じ前提にしない。
- 意思決定までつなぐ。 閾値未満を検索・再生成・確認質問・人間へ回したときのcoverage-riskを測る。
- 更新後に再較正する。 モデル、system prompt、ツール、データ分布の変更は、過去の較正をそのまま保証しない。
このページの計算機は二値・小標本・5-binの説明用実装です。多クラスBrier、連続予測、ECEの信頼区間、adaptive calibration error、token-level Full-ECE、選択的予測のrisk-coverageは実装していません。accuracy/coverageの区間が必要な場合は、信頼性図ツールのWilson 95%区間を、固定した評価条件の記述的な目安として使ってください。実運用の合否基準をこのUIの値だけで決めないでください。
棄権しきい値を動かしたときの回答率と正答率のトレードオフは、トップ特集の選択的予測シミュレーターで確認できます。較正指標とrisk-coverageは補完関係にありますが、同じ問いに答える数値ではありません。
参照した一次情報
- Guo, Pleiss, Sun & Weinberger (2017), On Calibration of Modern Neural Networks, ICML / PMLR 70:1321–1330. PMLR ↗
- Kängsepp, Valk & Kull (2025), On the Usefulness of the Fit-on-the-Test View on Evaluating Calibration of Classifiers, Machine Learning 114, 105. DOI ↗
- Jiang, Araki, Ding & Neubig (2021), How Can We Know When Language Models Know? On the Calibration of Language Models for Question Answering, TACL 9, 962–977. ACL Anthology ↗
- Brier (1950), Verification of Forecasts Expressed in Terms of Probability, Monthly Weather Review 78, 1–3. AMS ↗
- Testoni & Calixto (2026), Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features, EACL 2026, 2364–2382. ACL Anthology ↗
- Tayebati et al. (2025), CAP: Conformalized Abstention Policies for Context-Adaptive Risk Management for LLMs and VLMs, Proceedings of the 17th Asian Conference on Machine Learning, PMLR 304:926–941. PMLR ↗
- Rubashevskii et al. (2026), Adaptive Conformal Prediction for Improving Factuality of Generations by Large Language Models, arXiv preprint. arXiv ↗
- Xu et al. (2026), Geometry-Calibrated Conformal Abstention for Language Models, arXiv preprint. arXiv ↗
- 吉川和・岡崎直観 (2025), 訓練データを用いた言語モデル生成の確信度推定, 自然言語処理 32(1), 91–113. J-STAGE ↗
- Liu et al. (2024), Full-ECE: A Metric For Token-level Calibration on Large Language Models, arXiv preprint. arXiv ↗
- Matta, Naphade & Zou (2026), Rethinking Uncertainty Evaluation in Large Language Models, arXiv preprint / comments: ICML 2026 EIML Workshop. arXiv ↗
- Agnimo et al. (2026), Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination, arXiv preprint. arXiv ↗
- Ovadia et al. (2019), Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift, NeurIPS 32. NeurIPS ↗
- Seegmiller & Preum (2026), Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance, ACL 2026, 32685–32704. ACL Anthology ↗
- Tan et al. (2026), BaseCal: Unsupervised Confidence Calibration via Base Model Signals, ACL 2026, pp. 5172–5187. ACL Anthology ↗
- Traub et al. (2024), Overcoming Common Flaws in the Evaluation of Selective Classification Systems, NeurIPS 38. NeurIPS ↗
- Brown, Cai & DasGupta (2001), Interval Estimation for a Binomial Proportion, Statistical Science 16(2), 101–133. Project Euclid ↗
- Arrieta-Ibarra et al. (2022), Metrics of Calibration for Probabilistic Predictions, JMLR 23(351), 1–54. JMLR ↗
- Sun, Chaudhari, Barnett & Dobriban (2024), A Confidence Interval for the ℓ2 Expected Calibration Error, arXiv preprint. arXiv ↗
書誌情報・研究ステータスは2026-09-04に各一次情報で再確認しました。Matta et al. とAgnimo et al. は査読前preprintとして扱い、特定タスクの結果をLLM全般へ一般化していません。