先に結論
reasoningの長さと、確信の正しさは別の評価軸です。 正答率が上がっても較正が崩れることがあり、推論後の確信が高くても反証への更新が合理的とは限りません。
まず「いつの確信か」を固定します。問題を見た直後の成功確率、答えを出した後の正しさの確率、外部情報を受けた後の更新、低確信時に棄権できるかは、別々のラベルと指標で評価します。
ACCURACY
答えが当たるか
推論によって正答率や問題解決能力が上がったか。確信の数値が正しい確率を表すかとは別です。
CALIBRATION
推論後の数字が合うか
推論後に0.8と出した回答群が、およそ80%正しいか。ECE、Brier、信頼性図で確認します。
UPDATING
反証に反応できるか
初期回答を見せた場合、同じ答えに固執するか、逆に反対情報を過大評価するか。更新の軌跡を別に記録します。
1. 推論の前後で「確信」の問いを分ける
推論モデルに同じ「正解する確率」を尋ねても、問題を読んだ直後と、推論を終えて答えを選んだ後では利用できる情報が違います。前者は問題を解ける見込み、後者は実際に出した答えが正しい見込みとして、別の教師ラベルを持たせるべきです。
| 状態 | 確信が表す問い | 正解ラベル | 主な用途 |
|---|---|---|---|
| 推論前 | この問題を最終的に解けるか | 問題単位の成功/失敗 | 計算を続ける価値、難問のルーティング |
| 推論後 | いま出した答えは正しいか | 実際の最終回答の正誤 | 回答表示、棄権、再検証 |
| 情報更新後 | 新しい証拠で確信をどう変えるか | 更新後の正しさと更新方向 | 反証、確認質問、人間移譲 |
CALIBER: Calibrating Confidence Before and After Reasoning in Language Models
Finlay et al. は、推論前後の確信を同じ一つの値として扱わず、推論前は問題レベルの成功、推論後は実現した回答の正しさに対応する教師を使うCALIBERを提案しています。要旨では、BigMathDigitsの7Bモデルで単一確信ベースラインよりECEを52.5%低減し、Brier scoreとAUROCでも良好な結果を報告しています。
これは2026年6月時点のpreprintです。数値は要旨に示された評価条件の結果であり、査読済みの一般則やすべての推論モデルへの保証として扱いません。
arXivで要旨・本文・バージョンを確認する ↗2. 2025–2026年の一次研究を条件つきで比較する
「推論モデルは較正が良い/悪い」という一文では、研究間の違いを隠します。ここでは、対象モデル、タスク、確信の取り出し方、主張の範囲を同じ表に置きます。
| 研究 | 何を見たか | 要旨・本文で確認できる主張 | 読み方の境界 |
|---|---|---|---|
| Yoon et al. NeurIPS 2025 ↗ | 6モデル × 6データセットの推論モデル比較 | 36条件中33条件で、推論モデルの較正が比較対象より良かったと報告。 | モデル、データセット、確信の引き出し方、指標、推論予算をそろえない一般化はできない。 |
| Mei et al. Findings EACL 2026 ↗ | reasoning modelの不確実性・過信・introspection | 評価条件では、深い推論が自動的に較正を改善せず、過信やモデル差が残ると報告。 | 「推論は常に悪い」という主張ではなく、深さだけを較正の代理にしないための結果。 |
| Khanmohammadi et al. EACL 2026 ↗ | 6つのLRM × 34万件超のreasoning traceで確信推定器を比較 | 論文の比較内では、text-based encoderがAUROC 0.672、structurally-aware modelがECE 0.148で最良。ただし単一手法が両方を支配しない。 | AUROCとECEは別の目的で、数値はRMCBのモデル・領域・正解ラベル・表現方法の条件内。別データやAPIの確信度へそのまま移植しない。 |
| Wang et al. ACL 2026 ↗ | GRPOの学習とcalibration-aware policy optimization | CAPO-1.5Bは複数の数学推論ベンチマークで較正を最大15%改善し、低確信時のprecision–coverageでも報告。 | CAPOの学習条件・モデルサイズ・ベンチマークの結果であり、既存モデルの推論を後から自動較正する手法ではない。 |
| Mao et al. Findings ACL 2026 ↗ | reasoning中のstepwise confidence | STLで時間的なconfidence patternを抽出し、正答・誤答を分ける軌跡を分析。 | 論文のtemporal logic・hypernetwork研究であり、単純なstep差分や外部tool trajectoryの保証ではない。 |
| Kumaran et al. Nature MInt 2026 ↗ | 初期回答の表示/非表示と外部助言への更新 | 初期回答を見せると固執しやすく、反対の助言には過敏に確信を下げるという二つの機構を報告。 | 主実験は制御された二段階・statelessな選択課題。自然な会話や全LLMの一般法則と同一視しない。 |
How Reliable are Confidence Estimators for Large Reasoning Models?
Khanmohammadi et al. は、臨床・金融・法律・数学と一般推論を含むデータから、6つの大規模推論モデルの347,496 reasoning traceを集めたRMCBを構築し、sequential・graph-based・text-basedなど10を超える表現ベースの確信推定法を比較しています。すべてのサンプルに正誤アノテーションがあるため、推定器の順位づけをaccuracyだけでなく、確信の識別力と確率の較正に分けて読めます。
要旨が報告する比較では、text-based encoderがAUROC 0.672、structurally-aware modelがECE 0.148でそれぞれ最良でしたが、両方を同時に支配する手法はありません。また、アーキテクチャを複雑にしても単純なsequential baselineを安定して上回るとは限らない、とされています。したがって実務では「最も高いAUROCの手法」をそのまま採用せず、誤答の順位づけ、確率のズレ、棄権時のcoverageを用途ごとに再測定します。
これは査読済みproceedingsのベンチマーク結果ですが、chunk-level hidden stateを中心とする表現ベース手法の比較です。論文の数値を、外部APIから得たverbalized confidence、claim-level factuality、あるいは本番の安全性へ一般化しません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Calibration-Aware Policy Optimization for Reasoning LLMs
Wang et al. は、GRPOが不確実性を考慮しないadvantage estimationによって、正答率を改善する一方で較正を損なう可能性を分析し、CAPOを提案しました。抄録では、CAPO-1.5Bの較正改善、GRPOと同等以上の正答率、推論時スケーリングでの改善、低確信時のPareto-optimalなprecision–coverage trade-offを報告しています。
この研究が示すのは、reasoningの学習目的に較正を組み込む設計の一例です。既存APIの確信度を測るだけの監査、CAPのようなconformal abstention、推論前後の状態分離とは役割が異なります。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning
Mao et al. は、reasoning中のconfidenceを一つのscalarへまとめず、Signal Temporal Logic(STL)でstepwiseな変化を表現・マイニングする枠組みを提案しています。要旨では、時間的パターンがタスク間で一般化しうる一方、数値パラメータは質問に敏感であること、hypernetworkによる推定がbaselineより較正されることを報告しています。
ここから得る示唆は、推論後の一つのconfidenceだけでなく、時間順のログを残すことです。本ページの監査はSTLやhypernetworkを再現せず、推論前後の比較と説明用の記述統計に限定します。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Competing Biases underlie Overconfidence and Underconfidence in LLMs
Kumaran et al. は、初期回答を見せる/隠す、同じ助言/反対の助言、助言の正確さを操作した二段階実験を行いました。主実験ではGemma 3 12Bの都市緯度の二択課題を使い、初期回答を見せた条件と隠した条件で、答えを変える率が異なりました。助言役の回答も実在の別モデルではなく、条件として定義された制御刺激です。
この設計の価値は、確信の値だけでなく「確信に従って答えを変えるか」を同時に測れる点です。ただし、statelessな制御課題を、そのまま持続的なマルチターン対話の挙動とはみなしません。
Nature Machine Intelligenceで本文・方法・補足資料を確認する ↗3. 推論前後の確信を同じデータで監査する
6件の二値予測について、推論前の確信、推論後の確信、最終回答の正誤を入力します。前後それぞれの5-bin ECEとBrier scoreを計算し、確信がどれだけ動いたかを正答・誤答別の記述統計で確認できます。
推論前後の確信ミニ監査
ECEは小さいほどビン平均のズレが小さく、Brier scoreも小さいほど良い。平均変化は記述統計(推論後−推論前)であり、研究固有の指標やCALIBER/CAPOの実装ではありません。
| ケース | 推論前 p | 推論後 p | 結果 y | 変化(後−前) |
|---|
小標本の値は説明用です。推論前後の確信を比較する場合も、データ分割、temperature scaling、確信を引き出すプロンプト、推論予算、タスク分布を別々に記録してください。
4. 実装・評価の順番
- 状態を固定する。 推論前・推論中・推論後のどの時点の確信か、入力と出力のどちらを正解ラベルにするかを先に決める。
- 正答率と較正を分ける。 accuracyだけでなく、推論後のECE、Brier、AUROC、信頼性図を同じ評価分割で出す。
- 更新条件を操作する。 初期回答の表示/非表示、同意/反証、助言の品質、会話履歴の有無を別条件にして、確信の変化を記録する。
- 分布外を試す。 数学・知識・推論・日本語など、タスクや難易度が変わったときに確信の尺度が崩れないか確認する。
- 識別力と較正を別々に選ぶ。 AUROCは誤答を低確信側へ並べられるか、ECE・Brierは確率の大きさが正答率に合うかを見ます。RMCBのように最良の手法が指標ごとに分かれる場合は、採用目的に対応する指標と棄権時のcoverageを同じ分割で再評価します。
- 棄権を別に採点する。 低確信時のprecision–coverage、移譲率、残余risk、確認コストを測り、較正値だけで運用可否を決めない。
- 研究ステータスを残す。 査読済みproceedings、journal、preprintを区別し、モデル・データセット・確信の取得方法・限界を引用の近くに書く。
推論モデルの「考える時間」は、内部計算量、出力された推論テキスト、推論予算、複数サンプルの探索を同じ意味で表しません。研究間の結果を比べるときは、reasoningという名称ではなく、実際の測定条件をそろえてください。
参照した一次情報
- Yoon et al. (2025), Reasoning Models Better Express Their Confidence, NeurIPS 38. NeurIPS ↗
- Mei et al. (2026), Reasoning about Uncertainty: Do Reasoning Models Know When They Don’t Know?, Findings of EACL 2026. ACL Anthology ↗
- Khanmohammadi et al. (2026), How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains, EACL 2026, 1669–1754. ACL Anthology ↗
- Wang et al. (2026), Calibration-Aware Policy Optimization for Reasoning LLMs, ACL 2026, 18375–18390. ACL Anthology ↗
- Mao et al. (2026), Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning, Findings of ACL 2026, 9952–9976. ACL Anthology ↗
- Kumaran et al. (2026), Competing Biases underlie Overconfidence and Underconfidence in LLMs, Nature Machine Intelligence 8, 614–627. Nature / DOI ↗
- Finlay et al. (2026), CALIBER: Calibrating Confidence Before and After Reasoning in Language Models, arXiv preprint. arXiv ↗
既存研究の書誌情報・研究ステータスは2026-09-04に各一次情報で再確認しました。研究結果は対象モデル、タスク、確信の取り出し方、指標の範囲を越えて一般化していません。