先に結論
agent confidenceは、一つの確率ではなく、状態ごとの問いの束です。 タスクを完了できるか、次のactionは正しいか、tool outputは信頼できるか、その証拠で十分か、最後に答えるか人へ渡すかを分けないと、検索しただけの過信や、途中の失敗兆候を見失います。
ACL 2026のagent UQ研究は、単発QA中心のUQをインタラクティブな設定へ広げる必要を整理しています。このページはその研究を一つの標準分類として断定せず、運用ログへ落とすための編集上の地図として提示します。
TASK
完了できるか
最終的なタスク成功の見込み。途中の一回のtool callが正しくても、完了確率とは別です。
ACTION / TOOL
次の操作は正しいか
選んだtool、引数、順番が妥当か。tool outputを受け取る前の判断を別に採点します。
ANSWER / HANDOFF
答えるか、渡すか
最終回答を出す、再検索する、確認質問をする、人間へ移譲する、棄権するを分岐させます。
1. Agent UQを8つの問いへ分ける
以下は、研究で共通に採用された固定分類ではありません。エージェントのログを「何が不確かなのか」へ分解するための編集上の座標です。confidenceの値と正解ラベルの単位を、行ごとにそろえて記録します。
| 層 | 問い | 観測するログ | 次の判断 |
|---|---|---|---|
| task | このタスクを完了できるか | episodeの成功/失敗、制約違反 | 続行、モデル変更、human handoff |
| action | 次の操作は正しいか | 選んだtool、引数、順序、代替案 | 実行、再計画、確認 |
| tool | tool outputは十分信頼できるか | tool種別、応答、エラー、鮮度 | 採用、再実行、別tool |
| evidence | 証拠は支持・不足・反証のどれか | 出典、支持範囲、矛盾、claim | 回答、再検索、claim検証 |
| state | いまの情報で十分か | 未確定パラメータ、欠落条件 | 質問、仮定の明示、保留 |
| trajectory | 途中の確信変化は失敗兆候か | step/turn/tool call別のconfidence | 再評価、停止、監督 |
| answer | 最終回答は正しいか | 回答・claim・独立ラベル | 表示、訂正、棄権 |
| handoff | 人間確認・再検索・棄権へ回すべきか | リスク、確信、可逆性、費用 | 自動実行の範囲を決める |
task成功、action正解、tool出力の支持、最終answerの正しさは、同じ0/1ラベルに変換できるとは限りません。RAGのevidence statusとfactualityを分ける考え方は、RAGの不確実性ルーティングでも詳しく扱っています。
2. 「検索したから安心」は成立しない
同じtool useでも、何を返す道具かで確信の意味が変わります。evidence toolは外部情報を増やしますが、ノイズ・古さ・検索意図とのズレを同時に持ち込みます。verification toolはテストや計算結果のようなフィードバックを返しますが、検証したのはその性質の範囲だけです。
| tool type | 減らしたい不確実性 | 確信が上がる前に確認すること | 残る境界 |
|---|---|---|---|
| evidence | 外部事実・候補資料の不足 | 出典の時点、主体、条件、反証、claimへの支持 | 検索結果の存在は、最終回答の正しさを保証しない |
| verification | 計算・形式・実行結果の不確実性 | 何を検査したか、テスト範囲、入力の妥当性 | 通過した検査の範囲を越えて答え全体を保証しない |
| other | 状態の取得、変換、外部操作など | 成功応答と目的達成を別に記録する | toolの成功とtask/answerの成功は別ラベル |
The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
Xuan et al. は、tool-integrated workflowでのverbalized calibrationを調べ、要旨ではtool typeによるconfidence dichotomyを報告しています。pilot studyの範囲では、web searchのようなevidence toolは検索情報のノイズと結びついた過信を生み、code interpreterのようなverification toolは決定的なフィードバックでmiscalibrationを抑えうる、という対照です。
これは「検索は危険、コードは安全」という一般法則ではありません。論文の評価条件・tool実装・confidenceの出し方に依存する結果です。本ページのツールもtool種別ごとの記述統計を出すだけで、因果効果や安全保証を推定しません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗3. 答える前に、何が分からないのかを聞く
曖昧な依頼では、「モデルが答えを知らない」ことと「ユーザーが何を望むか決まっていない」ことが混ざります。前者をmodel uncertainty、後者をspecification uncertaintyとして分けると、答えを続けるのか、tool引数を確認するのかを設計しやすくなります。
SPECIFICATION UNCERTAINTY
ユーザーの意図が未確定
同じ言葉でも、対象・時点・予算・権限などtool parameterの候補が複数ある。まず質問の価値を考えます。
MODEL UNCERTAINTY
予測や選択に自信がない
仕様は決まっていても、次のtool・引数・答えの候補をモデルが区別できない。再検索や検証の候補になります。
QUESTION VALUE
聞けば行動が変わるか
質問を増やすこと自体を目的にせず、答えが変わる可能性と質問コストを比べます。
Structured Uncertainty guided Clarification for LLM Agents
Suri et al. は、tool parameterとそのdomain上でstructured uncertaintyを定式化し、specification uncertaintyとmodel uncertaintyを分離します。潜在的な質問の価値をExpected Value of Perfect Information(EVPI)で捉え、質問コストも考慮して、何をいつ聞くかを選ぶ枠組みです。ClarifyBenchというmulti-turn dynamic tool-calling disambiguation benchmarkも提示しています。
要旨の評価では、SAGE-Agentのcoverage向上やclarification数の削減、When2Callの3B/7Bモデルでの改善が報告されていますが、いずれも論文固有のagent・benchmark・訓練条件における結果です。EVPIやSAGE-Agentをこのページの小さな監査が再現するわけではありません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗運用上は、質問を出す前に「答えが変わるparameterは何か」「確認できないまま実行すると何が起きるか」「質問しない代替はあるか」をログへ残します。単に低いconfidenceを見て質問するだけでは、model uncertaintyと仕様の曖昧さを取り違えます。
4. 確信をstep/tool callの軌跡として読む
会話のターン別較正は、ユーザーとのやり取りの時間軸です。reasoningの前後比較は、内部推論や推論予算の軸です。agent trajectoryでは、外部action、tool output、再計画、確認、停止までを同じepisodeで追います。この差を残すと、「途中で確信が上がったのに、失敗へ近づいた」ケースを拾えます。
| step | ログに残す | 再評価する問い | 分岐例 |
|---|---|---|---|
| plan | 目標、制約、未確定parameter、初期confidence | 仕様は十分に決まっているか | clarify / plan |
| act | tool名、引数、次actionのconfidence | この操作は目的に直接効くか | call / revise |
| observe | output、エラー、鮮度、evidence status | 何の不確実性が減ったか | accept / verify / retrieve |
| answer | claim、最終confidence、outcome、handoff | 回答を出す条件が満たされたか | answer / abstain / handoff |
Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning
Mao et al. は、推論全体を一つのscalarへ要約せず、stepwise confidence signalをSignal Temporal Logic(STL)で特徴づけます。要旨では、正しい回答と誤った回答を分けるtemporal patternを発見し、parameter hypernetworkを使うconfidence estimationを提案したと説明しています。
本ページの軌跡監査は、STL mining、hypernetwork、temporal logicを実装していません。入力されたconfidenceの差分、tool type別の集計、失敗ステップの列挙という記述的な問いだけに限定しています。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗会話の長さに対する確信変化は、マルチターン較正でper-turn calibrationと情報追加を分けて測ります。推論の確信を前後で分ける場合は、reasoningモデルの確信で推論予算や正解ラベルの条件をそろえます。
5. 研究を同じ「agent confidence」にしない
2026年の研究は、agent UQの定式化、tool type、clarification、stepwise reasoning、multi-turn、claim-levelなど、異なる単位を扱います。下表は「どの層の不確実性を測ったか」を比較するためのもので、結果の優劣を順位づける表ではありません。
| 研究 | 対象 | confidenceの粒度 | 主な評価軸 | 運用へ持ち込む境界 |
|---|---|---|---|---|
| Oh et al. ACL 2026 ↗ | interactive LLM agents | agent/異種entity/動的状態 | 一般的なagent UQ、4つの課題、benchmark粒度 | 全体像を与える研究。個別のtoolや業務の保証ではない。 |
| Xuan et al. ACL 2026 ↗ | tool-use agents | verbalized task confidence | evidence/verification toolの較正差 | pilot studyと評価条件に依存。tool成功とanswer正解は別。 |
| Suri et al. Findings ACL 2026 ↗ | 曖昧なtool invocation | tool parameterの仕様/model uncertainty | EVPI、clarification、ClarifyBench | 質問価値の設計例。低confidenceだけで質問する実装ではない。 |
| Mao et al. Findings ACL 2026 ↗ | long-form reasoning | stepwise confidence | STL pattern、temporal calibration | reasoningの軌跡。外部toolや本番agentへ直接移植しない。 |
| Zhang et al. ACL 2026 ↗ | multi-turn interaction | turn-conditioned confidence | ECE@T、MTCal、ConfChat | 会話のターン軸。tool callの成功確率とは別の単位。 |
| Abbasli et al. arXiv 2026 ↗ | 長文のfactual claims | atomic claim | closed-box post-hoc calibration、selective intervention | 2026-08-23提出のpreprint。claimの正しさをagent完了率へ一般化しない。 |
| Liu・Wang arXiv 2026 ↗ | long-form factuality | claim-aware confidence | CURE、selective prediction | 2026-04-13提出のpreprint。学習済み手法であり、本ツールの監査とは別。 |
Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
Oh et al. は、LLM agentが複雑なタスクを扱う一方で、UQ研究の多くがsingle-turn QAに集中していると整理し、agent UQの一般的な定式化、agent特有の技術課題、今後の方向性を提示しています。要旨が挙げる課題には、uncertainty estimatorの選択、異種entityの不確実性、interactive systemでの不確実性 dynamics、fine-grained benchmarkの不足が含まれます。
このページは、この問題提起を「タスク・action・tool・evidence・state・trajectory・answer・handoff」という運用上の問いへ翻訳します。8層は論文の公式taxonomyとしてではなく、ログ設計と読者の判断を助ける編集上の分解です。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Confidence Should Be Calibrated More Than One Turn Deep
Zhang et al. は、会話履歴を条件に各turnでconfidenceを較正するmulti-turn calibrationを提案し、ECE@T、MTCal、ConfChatを用いて、ユーザーからのfeedbackが較正を悪化させる可能性も調べています。
agent trajectoryとmulti-turnは重なりますが同じではありません。前者は外部actionやtool outputを明示的に持ち、後者は会話履歴と情報追加の時間軸を中心に置きます。ツールのログへturnだけを記録して終わらせないための接続として参照します。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗6. 実装パターン:estimateからhandoffまで
研究手法をそのまま再現するのではなく、システム設計へ持ち込める最小のループへ変換します。各stepで「確信が上がったか」だけでなく、「何の不確実性が減ったか」を記録するのがポイントです。
| 段階 | 保存するもの | 低確信・矛盾時の候補 |
|---|---|---|
| estimate | task/action/tool/answerの対象とconfidence | 未確定parameterを列挙 |
| act | tool、引数、権限、可逆性 | safe action、clarify、再計画 |
| observe | output、鮮度、エラー、evidence status | verify、別evidence、停止 |
| re-estimate | confidenceのdeltaと理由ラベル | 上昇を過信とみなさず、支持範囲を再点検 |
| verify | 検査対象と通過範囲 | answer全体への一般化をしない |
| clarify / retrieve / abstain / handoff | 選択理由、質問コスト、棄権・移譲結果 | 自動実行の範囲を狭める |
確信が低いときの次の行動は、モデル・タスク・権限・失敗の可逆性によって変わります。最終回答のconfidenceだけで一律に止めるのではなく、ECE・Brier・selective riskの違いと、claim単位の監査を組み合わせます。
7. 失敗パターンを名前で固定する
ここでは、論文がそのまま使う用語と、ログ上の失敗を短く呼ぶための編集上のラベルを分けます。後者を論文の正式な概念や因果メカニズムとして見せないことが重要です。
EDITORIAL LABEL
evidence inflation
検索結果が増えたことを、支持の強さやanswerの正しさが増えたことと取り違える。
EDITORIAL LABEL
stale confidence
tool outputが古い・条件違いなのに、前のconfidenceを更新しない。
EDITORIAL LABEL
tool-success ≠ answer-correct
APIが200を返した、テストが一つ通った、という成功を最終回答の正解と混ぜる。
EDITORIAL LABEL
clarification avoidance
質問すれば引数が決まるのに、曖昧なまま実行してしまう。
EDITORIAL LABEL
self-confirming loop
同じ仮定に基づくtoolを繰り返し、独立した反証を増やさない。
BOUNDARY
confidence collapse
矛盾を検知して下げるのか、単にノイズで揺れるのかを分けずに「慎重」と呼ぶ。
このページと付属ツールは、temporal logic mining、RL calibration、EVPI最適化、conformal guarantee、agent benchmarkの再現、因果推定を実装していません。入力ログから記述的な差分・層別値・失敗件数を出し、次に何を独立評価すべきかを見えるようにする道具です。
8. 自分の軌跡をブラウザ内で監査する
研究の数値を再現するのではなく、手元のagentログで「どのstepで確信が動いたか」「evidenceタグの行で前行より0.05超上がったか」「上がったのに失敗したか」を確認する小さな監査です。入力は端末内だけで処理し、サーバーや外部APIへ送信しません。
Agent confidence trajectory audit ↗
CSVまたはtextareaでstep,confidence,outcome,tool_type,stageを入力し、全体・tool type別のaccuracy/Brier/ECEと、step間のconfidence deltaを比較します。説明用合成データを初期表示します。
参照した一次情報
- Oh et al. (2026), Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities, ACL 2026, pp. 16219–16250. ACL Anthology ↗
- Xuan et al. (2026), The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents, ACL 2026, pp. 11325–11349. ACL Anthology ↗
- Suri et al. (2026), Structured Uncertainty guided Clarification for LLM Agents, Findings of ACL 2026, pp. 40811–40838. ACL Anthology ↗
- Mao et al. (2026), Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning, Findings of ACL 2026, pp. 9952–9976. ACL Anthology ↗
- Zhang et al. (2026), Confidence Should Be Calibrated More Than One Turn Deep, ACL 2026, pp. 38578–38594. ACL Anthology ↗
- Zhang et al. (2026), Confidence Estimation for LLMs in Multi-turn Interactions, Findings of ACL 2026, pp. 25661–25676. ACL Anthology ↗
- Tan et al. (2026), BaseCal: Unsupervised Confidence Calibration via Base Model Signals, ACL 2026, pp. 5172–5187. ACL Anthology ↗
- Abbasli et al. (2026), Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models, arXiv:2608.22483, submitted 2026-08-23. arXiv ↗
- Liu・Wang (2026), Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration, arXiv:2604.12046, submitted 2026-04-13. arXiv ↗
ACL Anthologyの書誌ページとarXivの版・提出履歴を2026-09-04に確認しました。各ページで訂正・撤回の告知は確認できませんでしたが、preprintは査読前のステータスです。研究結果は、各論文の対象モデル、tool、データ、指標の範囲を越えて一般化していません。