先に結論:問いを二択にしない
2026年時点で、LLMを「人間と同じ意味で理解している」とも、「単なる模倣で何も扱っていない」とも、研究だけから一括して断定できません。 ただし、どの種類の理解に近い振る舞いが、どの条件で再現され、どの条件で崩れるかは測れます。
したがって、CONFIDENCEの問いは「理解しているか」ではなく、どんな証拠があれば、どの操作的な理解概念に、どの程度の確信を置けるかです。正答率、転移、因果的な更新、根拠への支持、説明のfaithfulness、確信の較正を同じものとして扱いません。
ABILITY
できること
未見の組合せを解く、状態を追う、反実仮想に答える、道具を使って計画を更新する。まず課題と条件を固定して測ります。
EVIDENCE
何が支えるか
一回の正答ではなく、分布を変えた再テスト、対話的な課題、因果介入、内部状態、独立した正解ラベルを組み合わせます。
CONFIDENCE
どこまで信じるか
能力の有無と、その確信の較正は別です。答えの正しさ、根拠の支持、低確信時の棄権を別々に監査します。
「2026年の常識」という言葉も一枚岩ではありません。科学的コンセンサス、専門家の有力仮説、実務上の安全な前提、一般社会の通念を分けると、議論の強さを取り違えにくくなります。
SCIENTIFIC CONSENSUS
科学的コンセンサス
再現研究と複数の独立評価が、同じ定義・条件で収束している状態。AIの「理解」全体について、ここまでの合意があるとは言いません。
LEADING HYPOTHESIS
有力仮説
説明力のある研究提案。ただし、別のタスク・分布・モデルで再現するまで、一般法則とは呼びません。
SAFE PREMISE
実務上の安全な前提
人間の確認、出典、拒否、独立評価を残すという運用ルール。モデルの内面についての形而上学的な判断とは別です。
SOCIAL COMMON SENSE
社会の通念
「会話できるなら理解している」「間違うなら理解していない」といった直観。検索意図として重要ですが、証拠の分類とは分けます。
「理解」を操作的な概念へ分解する
理解を測るときは、言語が滑らかか、答えが正しいか、内部表現が一貫しているか、外界に接地しているかを別の検査にします。下の表の右列まで書かれて初めて、claimの射程がそろいます。
| 操作的な概念 | 測る候補 | その結果だけでは言えないこと |
|---|---|---|
| 言語的な整合性 | 文脈に合う応答、参照、定義の使い分け | 主観経験や現実世界の接地 |
| 未見課題への一般化 | 新しい組合せ、分布外、反事実的な表現 | すべての領域での抽象概念の保持 |
| 因果・反実仮想 | 介入後の状態、反事実、長期計画の結果 | 因果モデルがLLM内部に自然に存在すること |
| world model / grounding | 状態追跡、環境応答、行動と結果の整合 | 物理世界や人間の経験をそのまま持つこと |
| 長期的一貫性 | マルチターンの記憶、自己矛盾、計画の維持 | 一貫性が意味理解の十分条件であること |
| 他者の意図推定 | belief、誤信念、視点、明示・暗黙の心的状態 | 意識や感情がモデルにあること |
| 説明のfaithfulness | 説明を変えたときの出力・内部状態への因果的影響 | 流暢な説明が実際の計算過程を写していること |
| 適応性・道具使用 | フィードバック、検索、検証、棄権、再計画 | 単体モデルが環境を理解していること |
理解と意識は別問題です。 「理解」を行動・表現・推論の操作的な概念として評価しても、それは主観経験、感情、自己意識の存在を証明しません。反対に、意識を定義しないまま、ベンチマークの正答から有無を推論することもできません。
「次トークン予測だから理解していない」はどこまで正しいか
次トークン予測は、LLMの学習目標を説明します。しかし、学習目標だけで学習後の内部表現や、入力に応じた一般化の仕方をすべて記述できるわけではありません。トークンで訓練されたモデルが、意味の同値類を単位にした確信を示せるかを調べる研究もありますが、それは特定のQA・サンプリング条件でのsemantic calibrationです。
Nakkiran et al. のICLR 2026研究は、意味クラスに対するB-calibrationを導入し、base LLMのsampling-basedな意味較正を分析しました。公式要旨が報告するinstruction tuningやchain-of-thoughtによる変化は、意味クラスとQA評価の結果です。ここから「人間のような意味理解」や「意識」を導くことはできません。
逆に、「次トークンを予測している」という事実だけから、すべての出力を局所的な暗記と呼ぶのも同じくらい射程が広すぎます。判断すべきなのは、学習目標のラベルではなく、未見の組合せ、介入、長期状態、誤り方、確信の更新が再現するかです。
Trained on Tokens, Calibrated on Concepts
意味クラスで較正を定義する研究。token-levelの学習目標から、概念単位の確信を測る評価へ移るときの、可能性と条件を示します。
理解しているように見える証拠
肯定側の証拠は、単なる流暢さではなく、入力の表面を変えても関係構造を保てるか、環境の状態と介入結果を追えるか、静的ベンチマーク以外でも能力が現れるかで見ます。
COMPOSITION
未見の組合せへ一般化する
Han & Padóは、SCAN・COGS・GeoQueryを使い、in-context learning問題を学習上の誘因として与えると、設定した条件でcompositional generalizationが改善することを報告しました。これは「関係の組み合わせを扱える」証拠ですが、全般的な意味理解の証明ではありません。
CAUSAL PLANNING
因果モデルを明示的に接続する
Gkountouras et al. は、因果表現学習とLLMを接続し、自然言語と因果変数を橋渡しする枠組みを提案しました。因果計画でLLMベースのreasonerを上回ったのは、LLM単体がすでに世界を理解したというより、明示的なcausal world modelを組み合わせた効果として読むべきです。
WORLD MODEL
テキスト環境の状態を予測する
査読前のFrom Word to Worldは、テキスト環境での次状態予測をworld modelとして定式化し、5環境で潜在状態の整合性とエージェント性能を評価しました。結果は環境の行動範囲と複雑さに依存し、現実世界のgroundingとは分けて扱います。
INTERACTIVE TESTS
静的スコア以外で差を見る
Momentè et al. は、標準ベンチマーク、interactive game、認知テストを比較し、モデルの差を識別する点ではinteractive gameが優れると報告しました。因果・論理推論は複数の評価と相関する一方、実行機能や社会・感情的能力では評価形式の差が現れました。
抽象的な関係を内部表現から検査する
Ni et al. はGeneralized Associative Recall(GAR)でcompositional relational reasoningを評価し、Vicuna-33Bのタスク間で再利用される回路と、true / falseの抽象概念を表すattention headのクラスを介入実験で調べました。内部表現を検査できることは重要ですが、特定のGAR課題の表現を人間の意味理解へ一般化しません。
これらの結果は、LLMが単純な文字列の暗記だけでは説明しにくい条件付き能力を示す、という主張を支えます。ただし、能力の存在から、人間と同じ内的経験・意識・感情を推論することは支えません。また、causal world modelの成功をLLM単体の内的世界モデルへ移すこともできません。
理解していないように見える証拠
失敗を「間違ったから理解していない」とは読みません。人間も間違うからです。重要なのは、どの概念に対して、どんな崩れ方をしたかです。表面の手掛かりへ依存するのか、複雑さで急に崩れるのか、説明と出力の因果がずれるのかで、反証される理解概念が変わります。
POTEMKIN
正答と概念表現が整合しない
Mancoridis et al. の査読前研究は、ベンチマークの正答だけでは、モデルが人間の解釈と整合する形で概念を扱ったか分からないと formalizeし、複数のモデル・課題・領域で「Potemkin understanding」を報告します。preprintの結果であり、すべての評価を無効にする定理ではありません。
SHORTCUT
パターンが変わると一般化しない
Lin et al. は、implicit reasoningが固定パターンのデータでは高精度になりうる一方、未固定パターンでは特定パターンへ過適合し、一般化に失敗することを報告しました。これはshortcut learningの証拠ですが、「すべての推論がshortcut」とまでは言いません。
COMPLEXITY
問題の深さで急に崩れる
ZebraLogicは、論理課題の複雑さが増すと精度が下がり、その制限がモデルサイズや推論時計算量を増やしても残ると報告しました。NeurIPS 2025のcontrolled puzzle研究も、複雑さの閾値を越えると精度が崩れ、推論努力が逆に減る現象を報告しています。
SOCIAL REASONING
心的状態の手掛かりに引っ張られる
Soubki & Rambowは、ToM研究16件を調べ、機械だけが利用しうるパターンの検証を行った研究が半数未満で、machine validationを行った研究では人間を超えたモデルを確認できなかったと報告しました。Kozachenko et al.も、明示的な心的状態の足場がある課題と暗黙推論で結果が異なり、語彙手掛かりが成績を動かすことを報告しています。
説明が流暢でも、faithfulnessは別に測る
Tutek et al. は、chain-of-thoughtに含まれる情報をモデルからunlearningし、予測が変わるかでparametric faithfulnessを測るFURを提案しました。4つのLMと5つのMCQAデータセットで、重要な推論ステップを消すと予測が変わる例を示しています。つまり、説明のfaithfulnessは検査可能な性質ですが、説明があること自体をfaithfulnessの証拠にはしません。
ベンチマークでは、何が測れているのか
ベンチマークは不要なのではなく、単独で「理解」の代理変数にしないことが重要です。ToMBenchは既存のToM評価について、範囲の狭さ、主観的判断、汚染を問題にし、8タスク・31能力・二言語の新規在庫を組み合わせました。それでも得られるのは、定義した社会認知課題の成績です。
Momentè et al. のtriangulationは、標準ベンチマーク、ゲーム、認知テストの相関が同じではないことを示します。NeurIPSのcontrolled puzzle研究は、既存の数学・コードベンチマークだけでなく、複雑さを操作できる環境、シミュレーター、内部traceを使いました。評価の数を増やすより、課題の表面を変え、正解ラベルと失敗の型を独立にすることが、理解に置く確信を強くします。
| 観測された結果 | 支持できるclaim | まだ言えないclaim |
|---|---|---|
| ベンチマーク高得点 | そのデータ・評価形式での能力 | 人間と同じ概念表現、意識 |
| 未見組合せへの転移 | 特定の構造を別の表面へ適用する能力 | すべてのドメインでの抽象化 |
| 因果計画の成功 | 定義した環境での状態予測・計画 | 外界全体をgroundedに理解していること |
| CoTの説明 | 検証対象となる言語的trace | 内部計算を完全に写した自己報告 |
| RAGの根拠支持 | 参照資料とclaimのfaithfulness | モデル内部の意味理解や知識の所有 |
| 高いconfidence | 較正できれば、同条件の正解頻度との対応 | 理解の深さ、意識、説明の真実性 |
引用が同じテーマを扱っているだけでは不十分です。ToMの失敗研究を「LLM全般に推論能力がない」の根拠にしない。hallucination検出を「意味理解がない」の根拠にしない。ベンチマーク高得点を意識の根拠にしない。このページでは、各研究の条件・評価単位・限界をclaimの直後に置きます。
ToMBench: Benchmarking Theory of Mind in Large Language Models
ToMを8タスク・31能力で評価し、既存評価の汚染と範囲の問題を明示した研究です。結果は「人間のようなToMがある/ない」の最終判定ではなく、心的状態の帰属課題をどう設計するかの材料として使います。
calibration・reasoning・groundingは、理解とは別の軸
CONFIDENCEの既存ページは、理解を一つのスコアにまとめるためではなく、判断を分解するためにあります。正しい答えを出す能力があっても、確信を適切に見積もれるとは限りません。根拠を引用できても、その根拠がclaimを支持するとは限りません。推論traceが整って見えても、内部計算のfaithfulnessは別に検証する必要があります。
| ここで聞く問い | 測るもの | 次に読む |
|---|---|---|
| 答えの確信は正しいか | confidenceと正解頻度の対応、ECE、Brier、selective risk | LLMの較正 |
| 考えた後に確信は更新されたか | 推論前後、過信、反証への更新、確信推定器 | reasoning modelの確信度 |
| 長文のどの部分が危ういか | atomic claim、semantic uncertainty、coverage-risk | claim-level confidence |
| 外部資料は回答を支持するか | KB scope、evidence status、faithfulness、拒否・再検索 | RAGの不確実性ルーティング |
| 会話の途中で整合するか | ターン別較正、情報の追加、長期的一貫性 | マルチターン較正 |
| 自分のデータで照合できるか | 信頼性図、bin / group / split、threshold、AUGRC | 信頼性図ツール |
理解を主張したいなら、まず理解の定義、評価分布、独立した正解、失敗の型、確信の取得方法を固定します。較正が良いから理解している、RAGで出典があるから理解している、reasoningが長いから理解している、という短絡をしません。
Future Lens:2126年から2026年の前提を見る
Future Lensは未来を当てるための欄ではありません。現在の前提、支持する証拠、説明できない亀裂、最強の反論、前提が変わる条件、そして見方を修正する観測を同じ画面に置く編集フレームです。
Evidence strength: Moderate / Social adoption: High / Change pressure: High / Forecast uncertainty: Very High
これは統計量や確率ではなく、研究の条件、実務での浸透、前提を変える圧力、未来の不確実性を分けて読むための定性的な編集評価です。
NOW / 2026
現在の安全な前提
LLMには、言語の整合、未見課題への転移、因果・計画、道具使用など、条件付きで測れる能力がある。一方で、その能力は課題・分布・モデル・評価形式に依存し、理解という単語だけで一括しない。
EVIDENCE
前提を支えるもの
composition、因果的な状態予測、interactive task、意味クラスの較正、説明の因果検査。単なる流暢さより、表面を変えても関係が保たれる証拠を重く見る。
CRACKS
前提では説明しにくいもの
shortcut、benchmarkの機械的手掛かり、complexity cliff、長期的な不整合、根拠とclaimのずれ、CoTの非faithfulness。これらは「理解ゼロ」ではなく、特定の理解概念への反証として読む。
COUNTERCASE
最強の反論
人間の理解も、間違い、近道、記憶、道具、訓練分布に支えられている。したがって、身体性や主観経験を満たさないからといって、機能的な理解を認めないのは人間中心的な基準かもしれない。問題は、機能的理解をどこまで一貫して再現できるかだ。
SHIFT / SCIENCE & TECH
科学・技術が変える条件
汚染耐性のあるinteractive benchmark、介入に耐える内部表現、長期環境でのworld state、分布外でも較正されたconfidenceが、複数モデル・複数領域で再現されること。逆に、失敗が偶然ではない一般則として整理されることも前提を変える。
SHIFT / INSTITUTIONS
社会構造・制度が変える条件
教育・医療・行政などで、答えの正しさだけでなく、根拠、拒否、監査ログ、責任分担、異議申立てが制度化されること。社会が「理解」という語を性能ラベルではなく監査可能な契約として使うこと。
SHIFT / VALUES
価値観・定義が変える条件
「理解」を内面の再現ではなく、他者と環境に対して説明可能で、反証に更新し、失敗時に止まれる関係能力と定義するのか。それとも意識・身体・経験を不可欠とするのか。定義の違いを隠さないことが先にある。
2126 / THOUGHT EXPERIMENT
未来から見た2026年
2126年の研究者が2026年を振り返るなら、LLMの「理解」を一つの発見としてではなく、複数の評価対象を一語で呼んでいた移行期として記述するかもしれません。これは仮説・思考実験であり、予測や確率ではありません。未来の判定は、現在の言葉ではなく、当時の評価データと定義の履歴に依存します。
FALSIFIER
何が起きたら見方を変えるか
次の観測が揃えば、現在の慎重な見方を更新します。反証側: 汚染耐性のある複数領域・長期・interactive評価で、能力・状態追跡・因果更新・confidenceの較正が一貫して再現され、shortcutやcomplexity collapseが説明できる一般モデルが得られること。反証の反対側: 見かけの転移が評価形式を変えると消え、内部状態・行動・説明が長期にわたり整合しないことが複数研究で再現されること。
現時点で言えること/言えないこと
CAN SAY
言える
LLMは条件付きで、言語的な関係、未見の組合せ、計画、根拠に基づく応答、意味単位の確信などを示す。評価は操作的概念ごとに作るべきです。
CANNOT SAY
まだ言えない
その能力だけから、人間と同じ意味理解、一般的なworld model、意識、感情、主観経験を確定できる。benchmarkやCoTをそのまま内面の窓にもできません。
NEXT TEST
次に測る
分布を変えた課題、独立ラベル、因果介入、長期対話、evidence status、claim-level confidenceを組み合わせ、低確信時の再検索・人間移譲まで含めて検証します。
AIが理解しているかを一語で決めるより、理解と呼びたい性質を分解し、その性質に合う証拠だけへ確信を配る。 それが、2026年にできる最も誠実な答えです。
参照した一次情報
このページでは、主要な科学的主張の根拠として一般ブログやSNSを使っていません。主要参照15件(原著・benchmark等14件+survey 1件。うち査読前preprint 2件)を、査読済みの原著・conference paperと査読前preprintに分けて扱います。systematic review / meta-analysisは主要根拠として採用していません(ToMのsurveyはsurveyとして扱います)。
- Han & Padó (2024), Towards Understanding the Relationship between In-context Learning and Compositional Generalization, LREC-COLING 2024. ACL Anthology ↗
- Chen et al. (2024), ToMBench: Benchmarking Theory of Mind in Large Language Models, ACL 2024. ACL Anthology ↗
- Gkountouras et al. (2025), Language Agents Meet Causality — Bridging LLMs and Causal World Models, ICLR 2025. ICLR proceedings ↗
- Ni et al. (2025), Benchmarking and Understanding Compositional Relational Reasoning of LLMs, AAAI 2025. AAAI ↗
- Lin et al. (2025), Implicit Reasoning in Transformers is Reasoning through Shortcuts, Findings of ACL 2025. ACL Anthology ↗
- Soubki & Rambow (2025), Machine Theory of Mind Needs Machine Validation, Findings of ACL 2025. ACL Anthology ↗
- Kozachenko et al. (2025), On the Role of Linguistic Features in LLM Performance on Theory of Mind Tasks, IWCS 2025. ACL Anthology ↗
- Tutek et al. (2025), Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps, EMNLP 2025. ACL Anthology ↗
- Momentè et al. (2025), Triangulating LLM Progress through Benchmarks, Games, and Cognitive Tests, Findings of EMNLP 2025. ACL Anthology ↗
- Lin et al. (2025), ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning, ICML 2025. PMLR ↗
- Shojaee et al. (2025), The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity, NeurIPS 2025. NeurIPS ↗
- Mancoridis et al. (2025), Potemkin Understanding in Large Language Models, arXiv preprint(査読前). arXiv ↗
- From Word to World (2025, revised 2026), Can Large Language Models be Implicit Text-based World Models?, arXiv preprint(査読前). arXiv ↗
- Nakkiran et al. (2026), Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs, ICLR 2026. ICLR ↗
- Farquhar et al. (2024), Detecting hallucinations in large language models using semantic entropy, Nature 630. Nature / DOI ↗
書誌情報・研究ステータス・claimの射程・掲載箇所・retraction / correction確認は、内部研究台帳(docs/RESEARCH_LEDGER.md)で管理しています。2026-09-04確認時点の整理であり、研究結果は各論文のモデル、データ、評価形式を越えて一般化していません。