このツールで分かること

THE SHORT ANSWER

信頼性図は、予測確率の平均と、その帯での実測正答率を比べる図です。 ただし、bin境界・bin方式・評価する層で結果は変わります。下のツールでは等幅と等頻度を同じ入力から並べ、任意のgroup・split別集計、固定thresholdのcoverage・selective risk、複数thresholdをまとめるAUGRCも確認できます。

入力は外部へ送信せず、改行区切りのconfidence,outcome[,group[,split]]をブラウザ内で解析します。groupはtask・model版・evidence statusなどの層名で、outcomeの正解ラベルとは別に記録してください。4列目はcalibration・testなどのラベルを比較するためのもので、較正mapやthresholdを自動で学習しません。モデル評価の合否、個別予測の信頼性、本番の棄権閾値を、この小標本の表示だけで決めないでください。

bin表のaccuracy、group・split・固定threshold表のaccuracyとcoverageには、固定した集計条件での95% Wilson区間を併記します。これは二項比率の点推定の幅を見るための表示で、ECEそのものの区間、依存データへの補正、threshold選択の不確実性、conformalな保証ではありません。

1. confidenceと正解ラベルを貼り付ける

1行に1件、confidence,outcome[,group[,split]]の順で入力します。confidenceは0〜1、outcomeは独立に判定した正解なら1、不正解なら0です。3列目のgroupは任意の層名(task、model版、evidence statusなど)、4列目のsplitはcalibration、selection、testなどの評価役割に使えます。group・splitがない行は、それぞれ「全体」「all」として扱います。ヘッダー、空行、#から始まるコメントは無視します。

例: 0.82,1,supported,test、0.88,0,insufficient,test。ここでのsupported / insufficient / refutedは根拠の状態を表すgroupラベルで、outcomeの正解ラベルとは別です。下の「根拠statusの合成例」は説明用データで、実運用の結果ではありません。group・split名は機密情報を含まない短いラベルにしてください。splitはラベルの比較だけを行い、mapやthresholdの選択には使いません。

2. 集約値を読む

ECEは各binの人数で重み付けした平均絶対誤差、MCEは最大のbin誤差、Brierは個々の確率と結果の二乗誤差です。等頻度binは各binの件数を近づけますが、同値の境界や端数の配分という別の実装判断が入ります。

—有効件数
—accuracy
—Brier score
—等幅 ECE
—等頻度 ECE

3. 図とbin表を比較する

4. 閾値で棄権したときのcoverageを読む

指定したthreshold以上のconfidenceだけを回答として残し、それ未満を棄権した場合のcoverageと、残した回答のselective risk(誤り率)を記述的に出します。これは特定の運用点を読む集計です。下のAUGRCは、confidenceの全thresholdを同じ入力で走査する方法比較用の要約なので、二つを同じ「保証」として扱いません。

—coverage
—selective risk
—回答した集合のaccuracy
—棄権件数
—AUGRC(全threshold)

coverageは回答を残した割合、selective riskは残した集合の誤り率です。AUGRCは、0を正解・1を失敗とする経験的なgeneralized riskをcoverage方向へ台形積分する、NeurIPS 2024の提案指標です。この表示は0〜1のraw areaで、実装によっては比較用に×1000で表示されます。低いほど、この入力上で受理した失敗の総量が小さいことを示しますが、較正値でもconformal predictionの有限標本保証でもありません。

5. 数字が変わったときの読み方

観察まず疑うこと次に固定する条件
等幅と等頻度でECEが違うbin境界と各binの重みbin数、方式、空bin、同値の扱いを評価レポートに記録する。
ECEは小さいがBrierが悪い平均のズレだけが小さい可能性確率の鋭さ、基準率、個々の誤信頼をBrierやNLLで確認する。
高confidence帯の件数が少ない実測正答率の分散が大きい可能性件数・accuracyの95% Wilson区間・層別結果を併記し、単一の棒を過信しない。
全体は良いが特定層だけ悪い集約によるサブグループや評価分布の変化の隠蔽モデル版、時期、タスク、難易度、顧客属性など運用上意味のある層で再集計し、ラベル付きデータで更新後に再検証する。

6. このツールの限界

ここでの信頼性図は、等幅または等頻度のbinで集約した説明用の診断です。Dimitriadis et al. は古典的なbinningが恣意的な実装判断に対して安定しない問題を指摘し、CORPという別の図式を提案しました。Błasiok & Nakkiranも、binningとECEの不連続性に対してSmoothECEを提案しています。

このページはCORP、SmoothECE、LCE、TCE、ECEの信頼区間、ブートストラップ、temperature scaling、AURC、conformal predictionを実装していません。bin・group・split・固定threshold表に表示するWilson区間は、accuracyまたはcoverageという二項比率だけを対象にした95%の記述的区間です。固定したbinやthresholdを同じデータで選んだこと、行どうしの依存、モデル・データ分布の不確実性は含みません。AUGRCは、入力されたconfidenceと二値outcomeから、同じconfidenceの行を同一thresholdにまとめた経験的な二値失敗集計だけを行います。generalized errorの差し替え、最適thresholdの選択、統計的保証は実装していません。group・split別の表はLCEやmulticalibrationではなく、入力したラベルごとの単純な再集計です。4列目を`calibration`や`test`にしても、較正mapの学習・threshold選択・最終評価を自動で分離する機能ではありません。groupを時期やモデル版にしても、分布距離・shiftの因果効果・本番の劣化を自動判定するものではありません。等頻度binを選んだから統計的に安定した、等幅binだから正しい、threshold表やAUGRCに保証がある、という意味でもありません。研究・本番評価では、独立した評価データ、十分な件数、層別、定義したラベル、比較可能なbin条件をそろえてください。較正・選択・最終評価の分離方針 ↗

PRIVACY / SCOPE

入力値はこのページのJavaScriptで処理し、外部送信するコードはありません。ただし、ブラウザや拡張機能、共有端末の挙動はこのページから保証できません。個人情報や機密ログは貼り付けないでください。

背景にある一次研究

Dimitriadis et al. / PNAS 2021(arXiv 2020)

Stable reliability diagrams for probabilistic classifiers

古典的なbinningが実装判断に対して不安定になりうる点を踏まえ、PAVによるCORPの信頼性図、再標本化などによる不確実性評価、Brier分解を提案した研究です。このツールはCORPの代替実装ではなく、bin方式の違いを可視化する入門用です。

PNAS ↗ arXiv ↗

Błasiok & Nakkiran / arXiv preprint(2023)

Smooth ECE: Principled Reliability Diagrams via Kernel Smoothing

観測をRBF kernelで平滑化してからECEを計算するSmoothECEを提案し、平滑化された図がその指標を可視化する構成を論じています。査読済み研究と同格に扱わず、ここではbinningの限界を説明する背景として紹介します。

arXiv ↗

Luo et al. / UAI 2022 / PMLR 180:1286–1295

Local calibration: metrics and recalibration

Luo et al. は、標準的なECEが集団全体の平均的な信頼性を測る一方、個別予測の近傍にある似た予測の信頼性を捉えるlocal calibration error(LCE)を提案しています。このツールのgroup表は、入力されたラベルごとの粗い再集計であり、特徴空間の近傍やLCEを計算するものではありません。

PMLRで要旨・書誌情報を確認する ↗

Gangrade, Kag & Saligrama / AISTATS 2021 / PMLR 130:2179–2187

Selective Classification via One-Sided Prediction

選択的予測は、予測の一部を棄権してcoverageとaccuracyを交換する問題です。このページのthreshold表は、confidence以上の行を残したときのcoverageとselective riskを記述するだけで、OSPの最適化、一般化境界、conformalな保証を実装しません。

PMLRで要旨・書誌情報を確認する ↗

Traub et al. / NeurIPS 2024 / DOI: 10.52202/079017-0076

Overcoming Common Flaws in the Evaluation of Selective Classification Systems

Traub et al. は、固定した運用点の評価と、複数thresholdで手法を比較する評価を分け、selective riskではなく「失敗かつ受理」のgeneralized riskを使うAUGRCを提案しました。要旨では6データセット・13種類のconfidence scoring functionで評価し、既存指標との順位が変わる例を報告しています。

ここでのAUGRCは、同研究のbinary failure設定に合わせた経験的な要約です。AUGRCが小さいことはECEが小さいこと、confidenceが確率として較正されていること、また本番のthresholdに保証があることを意味しません。

NeurIPSで要旨・書誌情報を確認する ↗

Arrieta-Ibarra et al. / JMLR 23(351) / 2022

Metrics of Calibration for Probabilistic Predictions

信頼性図やECEのようなbin・kernelベースの指標は、binを広げればランダムノイズを平均化できる一方で、確率軸の変化を細かく分解する力を失う、という統計的信頼性と解像度のトレードオフを整理しています。少数のgroupやbinで点推定だけを比較しない理由として参照します。

JMLRで本文・書誌情報を確認する ↗

Sun, Chaudhari, Barnett & Dobriban / arXiv preprint(2024)

A Confidence Interval for the ℓ2 Expected Calibration Error

ℓ2 ECEの区間推定を扱うpreprintです。top-1-to-k calibrationと非負性を含む別の推定対象であり、CONFIDENCEの等幅bin・等頻度binによるℓ1 ECEとは定義が違うため、このページではその区間推定を実装していません。

arXivで本文・版を確認する ↗

7. 監査前のチェックリスト

  • confidenceが何を表すか(top-1、verbalized、token、semantic class)を定義する。
  • 正解ラベルの定義、評価データの分割、モデルとタスクの版を固定する。
  • bin数・bin方式・境界・空bin・同値の扱いを記録する。
  • 件数と、可能ならbinごとの不確実性や信頼区間を併記する。
  • ECEだけでなくBrierまたはNLL、accuracy、AUROCやrisk-coverageを目的に応じて併記する。
  • 全体平均だけでなく、運用上重要な難易度・領域・ユーザー層をgroup列にして層別する。
  • 棄権thresholdごとにcoverage・selective risk・回答した集合のaccuracyを記録し、確認コストや誤りの重大さを別に定義する。

参照した一次情報

  • Guo, Pleiss, Sun & Weinberger (2017), On Calibration of Modern Neural Networks, ICML / PMLR 70. PMLR ↗
  • Dimitriadis, Gneiting & Jordan (2021), Stable reliability diagrams for probabilistic classifiers, PNAS 118. DOI ↗
  • Błasiok & Nakkiran (2023), Smooth ECE: Principled Reliability Diagrams via Kernel Smoothing, arXiv preprint. arXiv ↗
  • Xenopoulos et al. (2022), Calibrate: Interactive Analysis of Probabilistic Model Output, IEEE VIS 2022. arXiv ↗
  • Luo et al. (2022), Local calibration: metrics and recalibration, UAI / PMLR 180. PMLR ↗
  • Gangrade, Kag & Saligrama (2021), Selective Classification via One-Sided Prediction, AISTATS / PMLR 130. PMLR ↗
  • Traub et al. (2024), Overcoming Common Flaws in the Evaluation of Selective Classification Systems, NeurIPS 38. NeurIPS ↗

書誌情報・研究ステータスは2026-09-04に各一次情報で再確認しました。SmoothECEとℓ2 ECE区間はpreprintとして扱い、このページの計算機はCORP、SmoothECE、LCE、OSP、AURC、conformal prediction、ECEの信頼区間を実装していません。accuracy・coverageのWilson 95%区間だけを二項比率の記述的表示として追加しています。AUGRCはbinary outcomeの経験的な追加表示です。