先に結論
マルチターンの確信は、最終ターンの一つの数字ではなく、証拠に反応する軌跡として測る。 ACL 2026の研究は、対話中の確信に少なくとも「ターンごとの較正」と「情報が増えたときの更新の整合性」を求め、InfoECEという長さを考慮した指標と、Hinter-Guesserという制御された評価設定を導入しました。
同研究の要旨が報告する範囲では、既存の確信推定法はマルチターン対話で較正と更新の整合性に苦戦し、ログitベースの P(Sufficient) は、会話の水増しと証拠の蓄積を区別する手法として比較的よく機能しました。ただし、これは論文の評価条件における結果であり、すべてのモデル・業務にそのまま移せる万能スコアではありません。
1. 「情報が増えた」と「確信が上がった」は別
単一ターンでは、回答・確信度・正誤を一組のデータとして扱えます。ところが会話では、前の回答が次の文脈になり、ユーザーの訂正や追加情報も混ざります。最終回答だけを採点すると、途中で誤った方向へ確信が膨らんだことが見えなくなります。
PER-TURN CALIBRATION
各ターンで確信と正答率が対応するか
ターン2で0.8と申告した回答群が、同じ条件でおよそ80%正しいかを確認します。会話全体を平均した一つのECEでは代替できません。
UPDATE TRAJECTORY
根拠に反応して更新するか
有効な証拠が追加されたときは、確信が適切な方向へ動くかを見ます。反証が入って下がることは、必ずしも失敗ではありません。
EVIDENCE VS FILLER
会話の長さを証拠と取り違えないか
言い換え・相づち・冗長な推論が増えても、根拠が増えたとは限りません。入力のどこに情報利得があったかを別の列で記録します。
目標は「確信を単調に上げる」ことではない。情報を受け取ったとき、上げる・保つ・下げるの判断が、正しさと対応していることだ。
| 観測するもの | 問い | 記録する単位 |
|---|---|---|
| 確信度 | そのターンの回答をどの程度信じているか | ターンごとの数値または順序尺度 |
| 正しさ | そのターンの主張は、評価基準に照らして正しいか | 主張・回答・タスク単位のラベル |
| 情報追加 | 新しい事実・反証・曖昧さの解消が入ったか | 入力ターンの差分と種類 |
2. ACL 2026の研究が追加した視点
Confidence Estimation for LLMs in Multi-turn Interactions
Caiqi Zhang、Ruihan Yang、Xiaochen Zhu、Chengzu Li、Tiancheng Hu、Yijiang River Dong、Deqing Yang、Nigel Collierによる研究です。ACL Anthology掲載ページでは、マルチターンの確信推定を、per-turn calibrationとmonotonicityという二つの要件から評価すると説明しています。
ACL Anthologyで要旨・PDF・書誌情報を確認する ↗Confidence Should Be Calibrated More Than One Turn Deep
Zhang et al. は、会話履歴を条件にした複数ターンのconfidence calibrationを扱い、各turnの較正だけでなく、会話が進む過程での更新を評価します。要旨ではECE@T、MTCal、ConfChatを用い、ユーザーのfeedbackやpersuasionが確信の較正を悪化させうる可能性も検討しています。
これは、最後の回答だけを採点して会話全体を「較正済み」と呼ばないための研究です。agentの外部tool callやtask完了率を直接評価する研究ではないため、軌跡ログではturn軸とtool/action軸を分けて残します。
ACL Anthologyで要旨・PDF・書誌情報を確認する ↗この研究の実務上の重要点は、モデルに「最後に何%ですか」と尋ねるだけではなく、情報が追加される前後を評価設計に組み込むことです。InfoECEは、ターンの長さの違いを考慮して較正誤差を扱うための指標として提案されています。また、Hinter-Guesserは、会話のどの段階で情報が利用可能になるかを制御しながら評価するためのデータ生成パラダイムです。
要旨が報告する結果では、広く使われる確信推定手法は、対話が進むと較正と単調性の両方で難しさを見せました。一方、研究が提案するログitベースの P(Sufficient) は、証拠の蓄積と会話上のフィラーを追跡・区別する点で比較的有効でした。ここでの「比較的」は、論文内の比較対象と実験条件に依存する表現です。別モデルや別データセットで同じ優位性が再現するとは限りません。
「推論を深くすれば較正が良くなるか」は、論文間で一方向には決まりません。Yoon et al. のNeurIPS 2025論文は、6モデル・6データセットの36条件のうち33条件で推論モデルの較正が非推論モデルより良く、推論中の別解探索やbacktrackingなどのslow thinkingが確信の調整に寄与すると報告しました。Mei et al. の結果とは見かけ上異なるため、モデル、課題、確信の引き出し方、較正指標、推論予算の違いをそろえずに「reasoningは較正を改善する」と一般化しないことが重要です。
RELATED / ACTIVE CALIBRATION
確信が低いなら、確認質問を選ぶ
Li et al. のACL 2026論文は、非対話的な学習だけでは較正誤差に下限が残りうると分析し、較正誤差を手がかりに確認質問を選ぶInteractive Learning Strategyを提案しています。マルチターン評価を「測る」だけでなく、次の質問を「選ぶ」方向への接続です。
ACL 2026論文 ↗RELATED / REASONING
推論を深くすれば自動的に較正されるわけではない
Mei et al. のFindings of EACL 2026は、評価したreasoning modelが一般に過信し、推論を深くするとさらに過信する傾向を報告しています。introspectionの効果もモデル一様ではありません。対話の長さと推論の長さは、同じ変数ではない点に注意が必要です。
Findings of EACL 2026 ↗RELATED / SLOW THINKING
推論中の再検討が確信を調整する場合
Yoon et al. のNeurIPS 2025論文は、推論モデルがCoTの進行に応じて確信を更新し、非推論モデルもslow thinkingを促すだけで較正が改善しうると報告しました。ただし、Mei et al. との違いを含め、条件をそろえた比較が必要です。
NeurIPS 2025 ↗3. どの確信推定法を使うか
ブラックボックスAPIしか触れない場合と、ログ確率・隠れ状態・ログitを取得できる場合では、選べる方法が変わります。どの手法も、確信が高いことと正しいことを同一視しない検証が必要です。
| 方法 | 必要なアクセス | マルチターンで見るもの | 主な限界 |
|---|---|---|---|
| 言語化された確信 | 通常のAPIで可 | ターンごとの申告値と正答率 | プロンプトや表現形式に影響される。申告値だけでは較正済みといえない。 |
| トークン確率・系列確率 | logprobs等 | 同じ回答の確率が文脈でどう動くか | トークンの確率は意味単位の正しさと一致しない。系列長や分割にも依存する。 |
| 複数サンプルの一致・意味エントロピー | 複数生成。手法により確率や意味クラスタが必要 | 回答の意味が収束・分岐するか | 一致は正しさの証明ではない。生成回数とクラスタリングのコストがある。 |
P(Sufficient)のようなプローブ | 内部信号・プローブ設計 | 追加情報が十分か、フィラーか | 特定研究のモデル・訓練条件に依存し、APIだけの利用者は再現しにくい。 |
意味エントロピーは、トークンではなく回答の意味の分布を推定する考え方です。Farquhar et al. のNature 2024論文は、semantic entropyが幻覚検出に使える可能性を示しましたが、これも評価条件に依存する研究手法であり、すべてのAPIが同じ内部信号を公開するわけではありません。
Farquhar et al., Detecting hallucinations in large language models using semantic entropy ↗
4. 小さなマルチターン監査
下の表は、4つの会話ケースについて、4ターン分の確信と正誤を入力する簡易監査です。ターン別のECEと正答率、確信の下降回数を表示します。値は説明用のサンプルなので、実際のモデル性能を表しません。
ターン別の簡易ECE
ECEt = 各ビンの件数比 × |平均確信 − 正答率|。5ビン、4ケースの小標本です。InfoECEの実装ではありません。
| ケース | Turn 1 | Turn 2 | Turn 3 | Turn 4 |
|---|---|---|---|---|
| 仕様確認 | ||||
| 固有名詞 | ||||
| 曖昧な依頼 | ||||
| 反証提示 |
| ターン | 正答率 | 平均確信 | 件数 |
|---|
この監査で下降回数が増えても、即座に「悪い」とは判定しません。反証が入ったことで確信が下がり、しかも正答に近づくなら、更新としては合理的です。実運用では下降・上昇の原因を、新しい証拠/訂正/曖昧化/単なるフィラーに分けてラベル化してください。
5. 実装時の最小チェックリスト
- 単位を固定する。 1回答、1主張、1ターンのどれを採点するかを先に決め、途中で混ぜない。
- ターンを捨てない。 最終回答だけでなく、各ターンの確信・回答・入力差分・正誤ラベルを保存する。
- モデル条件を分ける。 モデル名、バージョン、温度、system prompt、ツール利用、会話長をログに残す。
- 証拠の種類を記録する。 新事実、ユーザー訂正、反証、曖昧さの解消、フィラーを同じ「追加情報」にしない。
- ターン別に採点する。 ECEだけでなく、正答率・平均確信・信頼性図・棄権率をターンごとに比較する。
- 介入を評価する。 確信が低いときに確認質問やRAG、人間への引き継ぎへ切り替えた結果を、coverage-riskの観点で測る。
小標本のECEは、ビンの切り方と偶然のラベルに大きく左右されます。このページのツールは考え方を試すためのものです。公開評価では、十分な件数を確保し、事前に定めたビン・信頼区間・データ分割・モデル条件を報告してください。
参照した一次情報
- Zhang et al. (2026), Confidence Estimation for LLMs in Multi-turn Interactions, Findings of ACL 2026, pp. 25661–25676. ACL Anthology ↗
- Zhang et al. (2026), Confidence Should Be Calibrated More Than One Turn Deep, ACL 2026, pp. 38578–38594. ACL Anthology ↗
- Li et al. (2026), Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human Evaluations, ACL 2026, pp. 5726–5759. ACL Anthology ↗
- Mei et al. (2026), Reasoning about Uncertainty: Do Reasoning Models Know When They Don’t Know?, Findings of EACL 2026, pp. 3408–3458. ACL Anthology ↗
- Yoon et al. (2025), Reasoning Models Better Express Their Confidence, NeurIPS 2025. NeurIPS ↗
- Farquhar et al. (2024), Detecting hallucinations in large language models using semantic entropy, Nature 630, 625–630. Nature / DOI ↗
書誌情報・研究ステータスは2026-09-04にACL Anthology、各出版社・論文アーカイブで再確認しました。論文の結論は、対象モデル・データセット・指標の範囲を越えて一般化していません。