このツールで分かること
信頼性図は、予測確率の平均と、その帯での実測正答率を比べる図です。 ただし、bin境界・bin方式・評価する層で結果は変わります。下のツールでは等幅と等頻度を同じ入力から並べ、任意のgroup・split別集計、固定thresholdのcoverage・selective risk、複数thresholdをまとめるAUGRCも確認できます。
入力は外部へ送信せず、改行区切りのconfidence,outcome[,group[,split]]をブラウザ内で解析します。groupはtask・model版・evidence statusなどの層名で、outcomeの正解ラベルとは別に記録してください。4列目はcalibration・testなどのラベルを比較するためのもので、較正mapやthresholdを自動で学習しません。モデル評価の合否、個別予測の信頼性、本番の棄権閾値を、この小標本の表示だけで決めないでください。
bin表のaccuracy、group・split・固定threshold表のaccuracyとcoverageには、固定した集計条件での95% Wilson区間を併記します。これは二項比率の点推定の幅を見るための表示で、ECEそのものの区間、依存データへの補正、threshold選択の不確実性、conformalな保証ではありません。
1. confidenceと正解ラベルを貼り付ける
1行に1件、confidence,outcome[,group[,split]]の順で入力します。confidenceは0〜1、outcomeは独立に判定した正解なら1、不正解なら0です。3列目のgroupは任意の層名(task、model版、evidence statusなど)、4列目のsplitはcalibration、selection、testなどの評価役割に使えます。group・splitがない行は、それぞれ「全体」「all」として扱います。ヘッダー、空行、#から始まるコメントは無視します。
例: 0.82,1,supported,test、0.88,0,insufficient,test。ここでのsupported / insufficient / refutedは根拠の状態を表すgroupラベルで、outcomeの正解ラベルとは別です。下の「根拠statusの合成例」は説明用データで、実運用の結果ではありません。group・split名は機密情報を含まない短いラベルにしてください。splitはラベルの比較だけを行い、mapやthresholdの選択には使いません。
2. 集約値を読む
ECEは各binの人数で重み付けした平均絶対誤差、MCEは最大のbin誤差、Brierは個々の確率と結果の二乗誤差です。等頻度binは各binの件数を近づけますが、同値の境界や端数の配分という別の実装判断が入ります。
3. 図とbin表を比較する
4. 閾値で棄権したときのcoverageを読む
指定したthreshold以上のconfidenceだけを回答として残し、それ未満を棄権した場合のcoverageと、残した回答のselective risk(誤り率)を記述的に出します。これは特定の運用点を読む集計です。下のAUGRCは、confidenceの全thresholdを同じ入力で走査する方法比較用の要約なので、二つを同じ「保証」として扱いません。
coverageは回答を残した割合、selective riskは残した集合の誤り率です。AUGRCは、0を正解・1を失敗とする経験的なgeneralized riskをcoverage方向へ台形積分する、NeurIPS 2024の提案指標です。この表示は0〜1のraw areaで、実装によっては比較用に×1000で表示されます。低いほど、この入力上で受理した失敗の総量が小さいことを示しますが、較正値でもconformal predictionの有限標本保証でもありません。
5. 数字が変わったときの読み方
| 観察 | まず疑うこと | 次に固定する条件 |
|---|---|---|
| 等幅と等頻度でECEが違う | bin境界と各binの重み | bin数、方式、空bin、同値の扱いを評価レポートに記録する。 |
| ECEは小さいがBrierが悪い | 平均のズレだけが小さい可能性 | 確率の鋭さ、基準率、個々の誤信頼をBrierやNLLで確認する。 |
| 高confidence帯の件数が少ない | 実測正答率の分散が大きい可能性 | 件数・accuracyの95% Wilson区間・層別結果を併記し、単一の棒を過信しない。 |
| 全体は良いが特定層だけ悪い | 集約によるサブグループや評価分布の変化の隠蔽 | モデル版、時期、タスク、難易度、顧客属性など運用上意味のある層で再集計し、ラベル付きデータで更新後に再検証する。 |
6. このツールの限界
ここでの信頼性図は、等幅または等頻度のbinで集約した説明用の診断です。Dimitriadis et al. は古典的なbinningが恣意的な実装判断に対して安定しない問題を指摘し、CORPという別の図式を提案しました。Błasiok & Nakkiranも、binningとECEの不連続性に対してSmoothECEを提案しています。
このページはCORP、SmoothECE、LCE、TCE、ECEの信頼区間、ブートストラップ、temperature scaling、AURC、conformal predictionを実装していません。bin・group・split・固定threshold表に表示するWilson区間は、accuracyまたはcoverageという二項比率だけを対象にした95%の記述的区間です。固定したbinやthresholdを同じデータで選んだこと、行どうしの依存、モデル・データ分布の不確実性は含みません。AUGRCは、入力されたconfidenceと二値outcomeから、同じconfidenceの行を同一thresholdにまとめた経験的な二値失敗集計だけを行います。generalized errorの差し替え、最適thresholdの選択、統計的保証は実装していません。group・split別の表はLCEやmulticalibrationではなく、入力したラベルごとの単純な再集計です。4列目を`calibration`や`test`にしても、較正mapの学習・threshold選択・最終評価を自動で分離する機能ではありません。groupを時期やモデル版にしても、分布距離・shiftの因果効果・本番の劣化を自動判定するものではありません。等頻度binを選んだから統計的に安定した、等幅binだから正しい、threshold表やAUGRCに保証がある、という意味でもありません。研究・本番評価では、独立した評価データ、十分な件数、層別、定義したラベル、比較可能なbin条件をそろえてください。較正・選択・最終評価の分離方針 ↗
入力値はこのページのJavaScriptで処理し、外部送信するコードはありません。ただし、ブラウザや拡張機能、共有端末の挙動はこのページから保証できません。個人情報や機密ログは貼り付けないでください。
背景にある一次研究
Stable reliability diagrams for probabilistic classifiers
古典的なbinningが実装判断に対して不安定になりうる点を踏まえ、PAVによるCORPの信頼性図、再標本化などによる不確実性評価、Brier分解を提案した研究です。このツールはCORPの代替実装ではなく、bin方式の違いを可視化する入門用です。
Smooth ECE: Principled Reliability Diagrams via Kernel Smoothing
観測をRBF kernelで平滑化してからECEを計算するSmoothECEを提案し、平滑化された図がその指標を可視化する構成を論じています。査読済み研究と同格に扱わず、ここではbinningの限界を説明する背景として紹介します。
Local calibration: metrics and recalibration
Luo et al. は、標準的なECEが集団全体の平均的な信頼性を測る一方、個別予測の近傍にある似た予測の信頼性を捉えるlocal calibration error(LCE)を提案しています。このツールのgroup表は、入力されたラベルごとの粗い再集計であり、特徴空間の近傍やLCEを計算するものではありません。
Selective Classification via One-Sided Prediction
選択的予測は、予測の一部を棄権してcoverageとaccuracyを交換する問題です。このページのthreshold表は、confidence以上の行を残したときのcoverageとselective riskを記述するだけで、OSPの最適化、一般化境界、conformalな保証を実装しません。
Overcoming Common Flaws in the Evaluation of Selective Classification Systems
Traub et al. は、固定した運用点の評価と、複数thresholdで手法を比較する評価を分け、selective riskではなく「失敗かつ受理」のgeneralized riskを使うAUGRCを提案しました。要旨では6データセット・13種類のconfidence scoring functionで評価し、既存指標との順位が変わる例を報告しています。
ここでのAUGRCは、同研究のbinary failure設定に合わせた経験的な要約です。AUGRCが小さいことはECEが小さいこと、confidenceが確率として較正されていること、また本番のthresholdに保証があることを意味しません。
Metrics of Calibration for Probabilistic Predictions
信頼性図やECEのようなbin・kernelベースの指標は、binを広げればランダムノイズを平均化できる一方で、確率軸の変化を細かく分解する力を失う、という統計的信頼性と解像度のトレードオフを整理しています。少数のgroupやbinで点推定だけを比較しない理由として参照します。
A Confidence Interval for the ℓ2 Expected Calibration Error
ℓ2 ECEの区間推定を扱うpreprintです。top-1-to-k calibrationと非負性を含む別の推定対象であり、CONFIDENCEの等幅bin・等頻度binによるℓ1 ECEとは定義が違うため、このページではその区間推定を実装していません。
7. 監査前のチェックリスト
- confidenceが何を表すか(top-1、verbalized、token、semantic class)を定義する。
- 正解ラベルの定義、評価データの分割、モデルとタスクの版を固定する。
- bin数・bin方式・境界・空bin・同値の扱いを記録する。
- 件数と、可能ならbinごとの不確実性や信頼区間を併記する。
- ECEだけでなくBrierまたはNLL、accuracy、AUROCやrisk-coverageを目的に応じて併記する。
- 全体平均だけでなく、運用上重要な難易度・領域・ユーザー層をgroup列にして層別する。
- 棄権thresholdごとにcoverage・selective risk・回答した集合のaccuracyを記録し、確認コストや誤りの重大さを別に定義する。
参照した一次情報
- Guo, Pleiss, Sun & Weinberger (2017), On Calibration of Modern Neural Networks, ICML / PMLR 70. PMLR ↗
- Dimitriadis, Gneiting & Jordan (2021), Stable reliability diagrams for probabilistic classifiers, PNAS 118. DOI ↗
- Błasiok & Nakkiran (2023), Smooth ECE: Principled Reliability Diagrams via Kernel Smoothing, arXiv preprint. arXiv ↗
- Xenopoulos et al. (2022), Calibrate: Interactive Analysis of Probabilistic Model Output, IEEE VIS 2022. arXiv ↗
- Luo et al. (2022), Local calibration: metrics and recalibration, UAI / PMLR 180. PMLR ↗
- Gangrade, Kag & Saligrama (2021), Selective Classification via One-Sided Prediction, AISTATS / PMLR 130. PMLR ↗
- Traub et al. (2024), Overcoming Common Flaws in the Evaluation of Selective Classification Systems, NeurIPS 38. NeurIPS ↗
書誌情報・研究ステータスは2026-09-04に各一次情報で再確認しました。SmoothECEとℓ2 ECE区間はpreprintとして扱い、このページの計算機はCORP、SmoothECE、LCE、OSP、AURC、conformal prediction、ECEの信頼区間を実装していません。accuracy・coverageのWilson 95%区間だけを二項比率の記述的表示として追加しています。AUGRCはbinary outcomeの経験的な追加表示です。