先に結論
長文回答の確信は、回答全体に一つだけ置かない。 まず「誰が・何を・どうした」のような原子主張へ分け、各claimの確信と正誤を同じ単位で較正します。
semantic entropyは意味の異なる回答がばらける不確実性、atomic calibrationは主張の確信と事実性の対応、selective generationは不確かな主張を残さない行動です。似ていても測っている対象は違います。
GRANULARITY
何を一件と数えるか
token・回答・意味クラス・atomic claimのどの粒度で確信を出したかを、正解ラベルとそろえます。
TARGET
何に対する確信か
世界の事実、参照資料への支持、意味の一致、役に立つ回答は同じ正解ではありません。
ACTION
不確かなclaimをどうするか
全回答を棄権するのではなく、主張だけを削る・出典を追加する・人間へ送る選択肢を残します。
1. 一つの「確信度」に混ぜてはいけない粒度
同じ文章から計算した数値でも、単位が違えば意味が変わります。token probabilityは次の断片の出やすさ、response-level confidenceは回答全体の集約、semantic uncertaintyは意味クラスのばらつき、claim-level confidenceは個別主張の事実性に対応します。
| 粒度 | 主な問い | 正解ラベルの例 | 見落としやすい点 |
|---|---|---|---|
| token | 次のtokenをどれだけ選びやすいか | token列・尤度 | 流暢な誤情報や長さの影響を、事実性と混同しやすい |
| response | 回答全体を返してよいか | 全体正解・全体品質 | 一部だけ誤った長文を一つの平均値で隠す |
| semantic class | 同じ意味の回答に収束しているか | 意味クラス・相互含意 | 意味の一致は、世界の事実の正しさとは別 |
| atomic claim | この主張は正しい/支持されるか | claimごとのfactuality・entailment | 分解規則・評価者・検証器の誤差が入る |
ここでの式は二値の説明用です。研究ごとにclaimの分割、confidence elicitation、正解の定義、ビン分割が異なるため、数値をそのまま横比較しません。
2. semantic uncertainty・semantic calibration・atomic calibration・selective generationを分ける
「意味が揺れている」「意味のconfidenceが正解率に対応しない」「claimの確信と事実性がずれている」「不確かな出力を残すべきでない」は、連続した運用でも別の評価軸です。測定、較正、行動を一枚のスコアに潰すと、改善した場所が分からなくなります。
| 概念 | 測るもの | 必要な観測 | 使う判断 |
|---|---|---|---|
| semantic uncertainty | 複数の生成が意味クラスに収束するか | 複数サンプル、意味クラスタ、相互含意 | 追加サンプル・検証・不確実性の検出 |
| semantic calibration | 意味空間のconfidenceと、選択した正解ラベルの対応 | 意味クラスタ、複数サンプル、confidence、正解ラベル | 識別力が高くても、確率の頻度対応まで示すとは限らない |
| atomic calibration | claim confidenceとfactualityの対応 | claim分解、confidence、claimごとの正誤 | どの主張を信用・修正するか |
| selective generation | 不確かなclaimを出さないときのrisk–coverage | 閾値、残したclaim、coverage、selective risk | 出力・棄権・人間移譲の境界 |
低いsemantic entropyは「意味が安定している」を示しても、「その意味が真実」を保証しません。 逆に、claim-level calibrationが良くても、分解前の一文が不完全なら評価対象から漏れます。意味の安定性、意味空間の確率対応、主張の事実性、運用上の棄権を別々に記録します。
意味空間の較正に、どこで介入するか
semantic uncertaintyを「誤りを並べる識別器」として使えることと、0.8という値が長期的な正解率0.8に対応することは別です。前者はAUROCなど、後者はECE・Brierやreliability diagramのように、同じ評価単位と正解ラベルで分けて報告します。
| 介入の層 | 例 | 変えるもの | 実務上の境界 |
|---|---|---|---|
| post-hoc | scalar temperature scaling | 既存のsemantic confidenceの尺度 | 校正用データと評価用データを分ける。モデルの知識やclaim分解そのものは直さない |
| training-time | semantic-level reward | 意味の一致と正誤を促す学習信号 | 学習・rollout・評価条件に依存し、API出力へそのまま移植できるとは限らない |
3. 一次研究が示す、長文確信の境界
研究は同じ「LLM confidence」を見ているわけではありません。査読済みの研究、ICLRの掲載研究、preprint、国内研究会資料を分け、どの条件で何が言えるかを残します。
Detecting hallucinations in large language models using semantic entropy
Farquhar et al. は、表面の文字列ではなく、意味を共有する回答をクラスタ化してentropyを計算します。長い回答ではfactoidへ分解し、各factoidに対応する質問への複数回答から意味のばらつきを測ります。
これは「同じ意味へ収束しているか」を扱う方法です。低entropyでも事実が正しいとは限らず、サンプリング、意味クラスタの判定、対象モデル・データセットに依存します。
Natureで方法・条件・補足資料を確認する ↗Atomic Calibration of LLMs in Long-Form Generations
Zhang et al. は、長文をatomic claimへ分解し、回答全体のmacro calibrationでは見えないclaim単位のfactuality calibrationを調べました。要旨では、長文生成でatomic calibrationがmacroより悪くなりうること、確信の取り出し方と生成位置によるパターンを報告しています。
この研究が直接測るのは長文生成のclaim-level calibrationです。claim分解・確信の取得方法・評価データが違えば、ページの簡易監査と同じ結果になるとは限りません。
ACL Anthologyで要旨・書誌情報・PDFを確認する ↗Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs
Nakkiran et al. は、意味クラスの選び方で定義される「B-calibration」を導入し、next-token predictionで学習したbase LLMが、特定のsampling-based semantic calibrationではQAの意味に対する確信を持ちうると説明しています。公式要旨では、instruction tuningとchain-of-thought reasoningがその較正を壊すという実験結果も報告されています。
「base modelの特定条件でのsemantic calibration」という主張を、APIモデル全般やclaim-level factualityへ広げません。意味クラス、サンプリング、instruction tuning、reasoningの条件を残して読みます。
ICLR 2026の公式poster・要旨を確認する ↗Improving Semantic Uncertainty Quantification in Language Model Question-Answering via Token-Level Temperature Scaling
Lamb et al. は、semantic confidenceの識別力と較正を別の性質として評価します。固定temperatureのヒューリスティックは、意味的不確実性の分布を系統的にずらしうる一方、単一のscalar temperatureを最適化するだけでも、QAタスクでsemantic calibration・discrimination・下流のentropyを改善したと報告しています。
これは意味空間のconfidence分布を調整する研究で、atomic claimの真偽や任意のAPIモデルへの保証ではありません。実運用では、temperatureを合わせる校正データと最終評価データを分け、AUROCの改善と確率の頻度対応を別々に報告します。
OpenReviewのICLR 2026掲載情報を確認する ↗ arXivで本文・版を確認する ↗Calibrating LLMs with Semantic-level Reward
Yu et al. のCSRは、verbalized confidenceのtoken-levelな表現に頼らず、意味空間へ直接calibration rewardを与える枠組みです。HotpotQAをin-distribution、TriviaQA・MSMARCO・NQ-Openをout-of-distributionとして3つのmodel familyを評価し、要旨ではverbalized-confidence baselineより低いECE・高いAUROC、最大40%のECE削減と31%のAUROC改善を報告しています。
これはpost-hocな温度調整とは異なり、correctness rewardとsemantic calibration rewardを学習時に組み合わせる提案です。査読前preprintであり、数値はモデル・rollout・データ分布・比較baselineに依存するため、一般の長文claimや本番APIへそのまま外挿しません。
arXivで要旨・本文・版を確認する ↗Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration
Liu・WangのCUREは、長文全体のscalar confidenceではなく、atomic claimと明示的なconfidenceを組み合わせるClaim-Aware Reasoning Protocolを提案しています。要旨では、4つのlong-form factuality benchmark、Biographyで最大39.9%のclaim-level accuracy改善、FactBenchでAUROC 16.0%増加を報告し、推論時のselective predictionへ接続します。
これは査読前preprintです。改善値は論文のモデル・ベンチマーク・学習条件に限定し、claim-level confidenceを付ければ任意の長文回答が安全になるとは扱いません。
arXivで要旨・本文・版を確認する ↗Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models
Abbasli et al. は、回答全体の粗いconfidenceをatomicで検証可能なclaim単位へ分解し、複数サンプルのconsistencyとself-verificationを使うclosed-boxのpost-hoc calibrationを提案しています。要旨では、logitやfine-tuningを必要とせず、TriviaQA・TruthfulQA、7つのbaseline、6モデルで評価し、ECE低減とselective retrieval/human reviewへの接続を報告しています。
これは2026-08-23提出のpreprintです。false premiseへの弱さを含む論文固有の境界があり、claim-levelの較正結果をagentのtask完了率や本番意思決定の安全保証へ一般化しません。
arXivで要旨・本文・版を確認する ↗レシピ文で学習したSemantic Entropy Probesによる数学問題解答の不確実性推定
田村優梨愛・松崎拓也は、日本語特化Decoder-onlyモデルの隠れ状態とNLIベースのsemantic entropyを使い、レシピ文で学習したロジスティック回帰を数学問題の解答へ適用しています。要旨では、ある程度の転移可能性、閾値によるAUCの変化、論理的整合性の方が予測しやすい場合を報告しています。
日本語での具体的な検討として価値がありますが、レシピ文・数学・NLIモデル・閾値設計に依存します。semantic entropyの普遍的な日本語モデル性能とは読みません。
J-STAGEで抄録・書誌情報を確認する ↗4. claim-levelの較正を同じデータで監査する
4つの回答に2件ずつclaimがあると仮定し、各claimのconfidenceと正誤を入力します。claim-level ECE / Brier、しきい値以上だけ残したcoverage / selective risk、回答全体をall-correctで見るmacro指標を並べます。
claim-level簡易監査
confidenceは0–1の説明用入力、correctは外部評価で付いた二値ラベルです。macroの「回答正解」は、その回答内のclaimがすべて正しい場合だけ1とする厳しい集約です。論文のデータや結果を再現するツールではありません。
| 回答 | claim | confidence | 正誤 | 選択 |
|---|
thresholdを同じ評価データに合わせて決めると、coverageやriskが楽観的になります。校正用データと報告用データを分け、claim分解規則・正解定義・評価者・検証器を固定してください。
根拠付き回答を評価する場合は、参照資料への支持(faithfulness)をgroup、claimの正しさをoutcomeとして別に記録します。支持をそのまま正解ラベルへ変換せず、信頼性図ツールの根拠status合成例 ↗で層別の見方だけを確認できます。
5. 実装・評価の順番
- claimの境界を先に決める。 主語・関係・条件・時点・数値を一つにするのか、一文をそのまま一claimとするのかを固定する。
- 正解の意味を分ける。 世界の真偽、参照資料への支持、意味クラスの一致、利用者にとっての有用性を同じラベルにしない。
- confidenceの出所を記録する。 verbalized confidence、token/logit、複数サンプル、hidden-state probe、検証器のどれを使ったかを残す。
- 識別力と較正を分ける。 AUROCなどで誤りを並べられても、confidence 0.8が長期的な正解率0.8に対応するとは限らない。semantic calibrationとatomic calibrationを、同じ分割・別の指標で報告する。
- macroとatomicを並べる。 回答全体のaccuracyだけでなく、claim-level ECE・Brier・AUROC・coverage-riskを同じ分割で報告する。
- 不確かなclaimだけを扱う。 低確信claimの削除・出典追加・再生成・人間確認を比較し、claimを消したことで回答の意味や文脈が壊れないかも評価する。
- 分布を変えて再確認する。 日本語、固有名詞、長文、数学、RAG、reasoningで、分解器・NLI・サンプリング温度の差が較正を変えないかを確認する。
claim-levelは粒度を細かくすれば自動的に良くなるわけではありません。分解漏れ、重複claim、評価者の不一致、主張間の依存関係が新しい誤差になります。長文を短い独立問題の集合として扱えるかを、対象タスクごとに検証します。
参照した一次情報
- Farquhar et al. (2024), Detecting hallucinations in large language models using semantic entropy, Nature 630, 625–630. Nature ↗
- Zhang et al. (2025), Atomic Calibration of LLMs in Long-Form Generations, Findings of IJCNLP–AACL 2025, 148–169. ACL Anthology ↗
- Nakkiran et al. (2026), Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs, ICLR 2026 poster. ICLR ↗
- Lamb et al. (2026), Improving Semantic Uncertainty Quantification in Language Model Question-Answering via Token-Level Temperature Scaling, ICLR 2026. OpenReview ↗ arXiv ↗
- Yu et al. (2026), Calibrating LLMs with Semantic-level Reward, arXiv preprint. arXiv ↗
- Liu・Wang (2026), Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration, arXiv preprint. arXiv ↗
- Abbasli et al. (2026), Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models, arXiv:2608.22483, submitted 2026-08-23. arXiv ↗
- 田村優梨愛・松崎拓也 (2025), レシピ文で学習したSemantic Entropy Probesによる数学問題解答の不確実性推定, 人工知能学会全国大会論文集. J-STAGE ↗
書誌情報・研究ステータスは2026-09-04にNature、ICLR、ACL Anthology、arXiv、J-STAGEで再確認しました。CURE、CSR、claim-level calibrationの新規研究はpreprint、国内資料は全国大会論文集として扱い、査読済みjournalと同格にしていません。