先に結論

THE SHORT ANSWER

agent confidenceは、一つの確率ではなく、状態ごとの問いの束です。 タスクを完了できるか、次のactionは正しいか、tool outputは信頼できるか、その証拠で十分か、最後に答えるか人へ渡すかを分けないと、検索しただけの過信や、途中の失敗兆候を見失います。

ACL 2026のagent UQ研究は、単発QA中心のUQをインタラクティブな設定へ広げる必要を整理しています。このページはその研究を一つの標準分類として断定せず、運用ログへ落とすための編集上の地図として提示します。

TASK

完了できるか

最終的なタスク成功の見込み。途中の一回のtool callが正しくても、完了確率とは別です。

ACTION / TOOL

次の操作は正しいか

選んだtool、引数、順番が妥当か。tool outputを受け取る前の判断を別に採点します。

ANSWER / HANDOFF

答えるか、渡すか

最終回答を出す、再検索する、確認質問をする、人間へ移譲する、棄権するを分岐させます。

1. Agent UQを8つの問いへ分ける

以下は、研究で共通に採用された固定分類ではありません。エージェントのログを「何が不確かなのか」へ分解するための編集上の座標です。confidenceの値と正解ラベルの単位を、行ごとにそろえて記録します。

層問い観測するログ次の判断
taskこのタスクを完了できるかepisodeの成功/失敗、制約違反続行、モデル変更、human handoff
action次の操作は正しいか選んだtool、引数、順序、代替案実行、再計画、確認
tooltool outputは十分信頼できるかtool種別、応答、エラー、鮮度採用、再実行、別tool
evidence証拠は支持・不足・反証のどれか出典、支持範囲、矛盾、claim回答、再検索、claim検証
stateいまの情報で十分か未確定パラメータ、欠落条件質問、仮定の明示、保留
trajectory途中の確信変化は失敗兆候かstep/turn/tool call別のconfidence再評価、停止、監督
answer最終回答は正しいか回答・claim・独立ラベル表示、訂正、棄権
handoff人間確認・再検索・棄権へ回すべきかリスク、確信、可逆性、費用自動実行の範囲を決める

task成功、action正解、tool出力の支持、最終answerの正しさは、同じ0/1ラベルに変換できるとは限りません。RAGのevidence statusとfactualityを分ける考え方は、RAGの不確実性ルーティングでも詳しく扱っています。

2. 「検索したから安心」は成立しない

同じtool useでも、何を返す道具かで確信の意味が変わります。evidence toolは外部情報を増やしますが、ノイズ・古さ・検索意図とのズレを同時に持ち込みます。verification toolはテストや計算結果のようなフィードバックを返しますが、検証したのはその性質の範囲だけです。

tool type減らしたい不確実性確信が上がる前に確認すること残る境界
evidence外部事実・候補資料の不足出典の時点、主体、条件、反証、claimへの支持検索結果の存在は、最終回答の正しさを保証しない
verification計算・形式・実行結果の不確実性何を検査したか、テスト範囲、入力の妥当性通過した検査の範囲を越えて答え全体を保証しない
other状態の取得、変換、外部操作など成功応答と目的達成を別に記録するtoolの成功とtask/answerの成功は別ラベル

ACL 2026 / Proceedings of ACL 2026, pp. 11325–11349 / DOI: 10.18653/v1/2026.acl-long.520

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

Xuan et al. は、tool-integrated workflowでのverbalized calibrationを調べ、要旨ではtool typeによるconfidence dichotomyを報告しています。pilot studyの範囲では、web searchのようなevidence toolは検索情報のノイズと結びついた過信を生み、code interpreterのようなverification toolは決定的なフィードバックでmiscalibrationを抑えうる、という対照です。

これは「検索は危険、コードは安全」という一般法則ではありません。論文の評価条件・tool実装・confidenceの出し方に依存する結果です。本ページのツールもtool種別ごとの記述統計を出すだけで、因果効果や安全保証を推定しません。

ACL Anthologyで要旨・書誌情報・PDFを確認する ↗

3. 答える前に、何が分からないのかを聞く

曖昧な依頼では、「モデルが答えを知らない」ことと「ユーザーが何を望むか決まっていない」ことが混ざります。前者をmodel uncertainty、後者をspecification uncertaintyとして分けると、答えを続けるのか、tool引数を確認するのかを設計しやすくなります。

SPECIFICATION UNCERTAINTY

ユーザーの意図が未確定

同じ言葉でも、対象・時点・予算・権限などtool parameterの候補が複数ある。まず質問の価値を考えます。

MODEL UNCERTAINTY

予測や選択に自信がない

仕様は決まっていても、次のtool・引数・答えの候補をモデルが区別できない。再検索や検証の候補になります。

QUESTION VALUE

聞けば行動が変わるか

質問を増やすこと自体を目的にせず、答えが変わる可能性と質問コストを比べます。

Findings of ACL 2026 / pp. 40811–40838 / DOI: 10.18653/v1/2026.findings-acl.2028

Structured Uncertainty guided Clarification for LLM Agents

Suri et al. は、tool parameterとそのdomain上でstructured uncertaintyを定式化し、specification uncertaintyとmodel uncertaintyを分離します。潜在的な質問の価値をExpected Value of Perfect Information(EVPI)で捉え、質問コストも考慮して、何をいつ聞くかを選ぶ枠組みです。ClarifyBenchというmulti-turn dynamic tool-calling disambiguation benchmarkも提示しています。

要旨の評価では、SAGE-Agentのcoverage向上やclarification数の削減、When2Callの3B/7Bモデルでの改善が報告されていますが、いずれも論文固有のagent・benchmark・訓練条件における結果です。EVPIやSAGE-Agentをこのページの小さな監査が再現するわけではありません。

ACL Anthologyで要旨・書誌情報・PDFを確認する ↗

運用上は、質問を出す前に「答えが変わるparameterは何か」「確認できないまま実行すると何が起きるか」「質問しない代替はあるか」をログへ残します。単に低いconfidenceを見て質問するだけでは、model uncertaintyと仕様の曖昧さを取り違えます。

4. 確信をstep/tool callの軌跡として読む

会話のターン別較正は、ユーザーとのやり取りの時間軸です。reasoningの前後比較は、内部推論や推論予算の軸です。agent trajectoryでは、外部action、tool output、再計画、確認、停止までを同じepisodeで追います。この差を残すと、「途中で確信が上がったのに、失敗へ近づいた」ケースを拾えます。

stepログに残す再評価する問い分岐例
plan目標、制約、未確定parameter、初期confidence仕様は十分に決まっているかclarify / plan
acttool名、引数、次actionのconfidenceこの操作は目的に直接効くかcall / revise
observeoutput、エラー、鮮度、evidence status何の不確実性が減ったかaccept / verify / retrieve
answerclaim、最終confidence、outcome、handoff回答を出す条件が満たされたかanswer / abstain / handoff

Findings of ACL 2026 / pp. 9952–9976 / DOI: 10.18653/v1/2026.findings-acl.484

Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning

Mao et al. は、推論全体を一つのscalarへ要約せず、stepwise confidence signalをSignal Temporal Logic(STL)で特徴づけます。要旨では、正しい回答と誤った回答を分けるtemporal patternを発見し、parameter hypernetworkを使うconfidence estimationを提案したと説明しています。

本ページの軌跡監査は、STL mining、hypernetwork、temporal logicを実装していません。入力されたconfidenceの差分、tool type別の集計、失敗ステップの列挙という記述的な問いだけに限定しています。

ACL Anthologyで要旨・書誌情報・PDFを確認する ↗

会話の長さに対する確信変化は、マルチターン較正でper-turn calibrationと情報追加を分けて測ります。推論の確信を前後で分ける場合は、reasoningモデルの確信で推論予算や正解ラベルの条件をそろえます。

5. 研究を同じ「agent confidence」にしない

2026年の研究は、agent UQの定式化、tool type、clarification、stepwise reasoning、multi-turn、claim-levelなど、異なる単位を扱います。下表は「どの層の不確実性を測ったか」を比較するためのもので、結果の優劣を順位づける表ではありません。

研究対象confidenceの粒度主な評価軸運用へ持ち込む境界
Oh et al.
ACL 2026 ↗
interactive LLM agentsagent/異種entity/動的状態一般的なagent UQ、4つの課題、benchmark粒度全体像を与える研究。個別のtoolや業務の保証ではない。
Xuan et al.
ACL 2026 ↗
tool-use agentsverbalized task confidenceevidence/verification toolの較正差pilot studyと評価条件に依存。tool成功とanswer正解は別。
Suri et al.
Findings ACL 2026 ↗
曖昧なtool invocationtool parameterの仕様/model uncertaintyEVPI、clarification、ClarifyBench質問価値の設計例。低confidenceだけで質問する実装ではない。
Mao et al.
Findings ACL 2026 ↗
long-form reasoningstepwise confidenceSTL pattern、temporal calibrationreasoningの軌跡。外部toolや本番agentへ直接移植しない。
Zhang et al.
ACL 2026 ↗
multi-turn interactionturn-conditioned confidenceECE@T、MTCal、ConfChat会話のターン軸。tool callの成功確率とは別の単位。
Abbasli et al.
arXiv 2026 ↗
長文のfactual claimsatomic claimclosed-box post-hoc calibration、selective intervention2026-08-23提出のpreprint。claimの正しさをagent完了率へ一般化しない。
Liu・Wang
arXiv 2026 ↗
long-form factualityclaim-aware confidenceCURE、selective prediction2026-04-13提出のpreprint。学習済み手法であり、本ツールの監査とは別。

ACL 2026 / Proceedings of ACL 2026, pp. 16219–16250 / DOI: 10.18653/v1/2026.acl-long.738

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

Oh et al. は、LLM agentが複雑なタスクを扱う一方で、UQ研究の多くがsingle-turn QAに集中していると整理し、agent UQの一般的な定式化、agent特有の技術課題、今後の方向性を提示しています。要旨が挙げる課題には、uncertainty estimatorの選択、異種entityの不確実性、interactive systemでの不確実性 dynamics、fine-grained benchmarkの不足が含まれます。

このページは、この問題提起を「タスク・action・tool・evidence・state・trajectory・answer・handoff」という運用上の問いへ翻訳します。8層は論文の公式taxonomyとしてではなく、ログ設計と読者の判断を助ける編集上の分解です。

ACL Anthologyで要旨・書誌情報・PDFを確認する ↗

ACL 2026 / Proceedings of ACL 2026, pp. 38578–38594 / DOI: 10.18653/v1/2026.acl-long.1787

Confidence Should Be Calibrated More Than One Turn Deep

Zhang et al. は、会話履歴を条件に各turnでconfidenceを較正するmulti-turn calibrationを提案し、ECE@T、MTCal、ConfChatを用いて、ユーザーからのfeedbackが較正を悪化させる可能性も調べています。

agent trajectoryとmulti-turnは重なりますが同じではありません。前者は外部actionやtool outputを明示的に持ち、後者は会話履歴と情報追加の時間軸を中心に置きます。ツールのログへturnだけを記録して終わらせないための接続として参照します。

ACL Anthologyで要旨・書誌情報・PDFを確認する ↗

6. 実装パターン:estimateからhandoffまで

研究手法をそのまま再現するのではなく、システム設計へ持ち込める最小のループへ変換します。各stepで「確信が上がったか」だけでなく、「何の不確実性が減ったか」を記録するのがポイントです。

段階保存するもの低確信・矛盾時の候補
estimatetask/action/tool/answerの対象とconfidence未確定parameterを列挙
acttool、引数、権限、可逆性safe action、clarify、再計画
observeoutput、鮮度、エラー、evidence statusverify、別evidence、停止
re-estimateconfidenceのdeltaと理由ラベル上昇を過信とみなさず、支持範囲を再点検
verify検査対象と通過範囲answer全体への一般化をしない
clarify / retrieve / abstain / handoff選択理由、質問コスト、棄権・移譲結果自動実行の範囲を狭める

確信が低いときの次の行動は、モデル・タスク・権限・失敗の可逆性によって変わります。最終回答のconfidenceだけで一律に止めるのではなく、ECE・Brier・selective riskの違いと、claim単位の監査を組み合わせます。

7. 失敗パターンを名前で固定する

ここでは、論文がそのまま使う用語と、ログ上の失敗を短く呼ぶための編集上のラベルを分けます。後者を論文の正式な概念や因果メカニズムとして見せないことが重要です。

EDITORIAL LABEL

evidence inflation

検索結果が増えたことを、支持の強さやanswerの正しさが増えたことと取り違える。

EDITORIAL LABEL

stale confidence

tool outputが古い・条件違いなのに、前のconfidenceを更新しない。

EDITORIAL LABEL

tool-success ≠ answer-correct

APIが200を返した、テストが一つ通った、という成功を最終回答の正解と混ぜる。

EDITORIAL LABEL

clarification avoidance

質問すれば引数が決まるのに、曖昧なまま実行してしまう。

EDITORIAL LABEL

self-confirming loop

同じ仮定に基づくtoolを繰り返し、独立した反証を増やさない。

BOUNDARY

confidence collapse

矛盾を検知して下げるのか、単にノイズで揺れるのかを分けずに「慎重」と呼ぶ。

WHAT THIS PAGE DOES NOT CLAIM

このページと付属ツールは、temporal logic mining、RL calibration、EVPI最適化、conformal guarantee、agent benchmarkの再現、因果推定を実装していません。入力ログから記述的な差分・層別値・失敗件数を出し、次に何を独立評価すべきかを見えるようにする道具です。

8. 自分の軌跡をブラウザ内で監査する

研究の数値を再現するのではなく、手元のagentログで「どのstepで確信が動いたか」「evidenceタグの行で前行より0.05超上がったか」「上がったのに失敗したか」を確認する小さな監査です。入力は端末内だけで処理し、サーバーや外部APIへ送信しません。

Agent confidence trajectory audit ↗

CSVまたはtextareaでstep,confidence,outcome,tool_type,stageを入力し、全体・tool type別のaccuracy/Brier/ECEと、step間のconfidence deltaを比較します。説明用合成データを初期表示します。

軌跡監査ツールを開く

参照した一次情報

  • Oh et al. (2026), Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities, ACL 2026, pp. 16219–16250. ACL Anthology ↗
  • Xuan et al. (2026), The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents, ACL 2026, pp. 11325–11349. ACL Anthology ↗
  • Suri et al. (2026), Structured Uncertainty guided Clarification for LLM Agents, Findings of ACL 2026, pp. 40811–40838. ACL Anthology ↗
  • Mao et al. (2026), Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning, Findings of ACL 2026, pp. 9952–9976. ACL Anthology ↗
  • Zhang et al. (2026), Confidence Should Be Calibrated More Than One Turn Deep, ACL 2026, pp. 38578–38594. ACL Anthology ↗
  • Zhang et al. (2026), Confidence Estimation for LLMs in Multi-turn Interactions, Findings of ACL 2026, pp. 25661–25676. ACL Anthology ↗
  • Tan et al. (2026), BaseCal: Unsupervised Confidence Calibration via Base Model Signals, ACL 2026, pp. 5172–5187. ACL Anthology ↗
  • Abbasli et al. (2026), Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models, arXiv:2608.22483, submitted 2026-08-23. arXiv ↗
  • Liu・Wang (2026), Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration, arXiv:2604.12046, submitted 2026-04-13. arXiv ↗

ACL Anthologyの書誌ページとarXivの版・提出履歴を2026-09-04に確認しました。各ページで訂正・撤回の告知は確認できませんでしたが、preprintは査読前のステータスです。研究結果は、各論文の対象モデル、tool、データ、指標の範囲を越えて一般化していません。