先に結論:問いを二択にしない

THE SHORT ANSWER

2026年時点で、LLMを「人間と同じ意味で理解している」とも、「単なる模倣で何も扱っていない」とも、研究だけから一括して断定できません。 ただし、どの種類の理解に近い振る舞いが、どの条件で再現され、どの条件で崩れるかは測れます。

したがって、CONFIDENCEの問いは「理解しているか」ではなく、どんな証拠があれば、どの操作的な理解概念に、どの程度の確信を置けるかです。正答率、転移、因果的な更新、根拠への支持、説明のfaithfulness、確信の較正を同じものとして扱いません。

ABILITY

できること

未見の組合せを解く、状態を追う、反実仮想に答える、道具を使って計画を更新する。まず課題と条件を固定して測ります。

EVIDENCE

何が支えるか

一回の正答ではなく、分布を変えた再テスト、対話的な課題、因果介入、内部状態、独立した正解ラベルを組み合わせます。

CONFIDENCE

どこまで信じるか

能力の有無と、その確信の較正は別です。答えの正しさ、根拠の支持、低確信時の棄権を別々に監査します。

2026 PREMISES

「2026年の常識」という言葉も一枚岩ではありません。科学的コンセンサス、専門家の有力仮説、実務上の安全な前提、一般社会の通念を分けると、議論の強さを取り違えにくくなります。

SCIENTIFIC CONSENSUS

科学的コンセンサス

再現研究と複数の独立評価が、同じ定義・条件で収束している状態。AIの「理解」全体について、ここまでの合意があるとは言いません。

LEADING HYPOTHESIS

有力仮説

説明力のある研究提案。ただし、別のタスク・分布・モデルで再現するまで、一般法則とは呼びません。

SAFE PREMISE

実務上の安全な前提

人間の確認、出典、拒否、独立評価を残すという運用ルール。モデルの内面についての形而上学的な判断とは別です。

SOCIAL COMMON SENSE

社会の通念

「会話できるなら理解している」「間違うなら理解していない」といった直観。検索意図として重要ですが、証拠の分類とは分けます。

「理解」を操作的な概念へ分解する

理解を測るときは、言語が滑らかか、答えが正しいか、内部表現が一貫しているか、外界に接地しているかを別の検査にします。下の表の右列まで書かれて初めて、claimの射程がそろいます。

操作的な概念測る候補その結果だけでは言えないこと
言語的な整合性文脈に合う応答、参照、定義の使い分け主観経験や現実世界の接地
未見課題への一般化新しい組合せ、分布外、反事実的な表現すべての領域での抽象概念の保持
因果・反実仮想介入後の状態、反事実、長期計画の結果因果モデルがLLM内部に自然に存在すること
world model / grounding状態追跡、環境応答、行動と結果の整合物理世界や人間の経験をそのまま持つこと
長期的一貫性マルチターンの記憶、自己矛盾、計画の維持一貫性が意味理解の十分条件であること
他者の意図推定belief、誤信念、視点、明示・暗黙の心的状態意識や感情がモデルにあること
説明のfaithfulness説明を変えたときの出力・内部状態への因果的影響流暢な説明が実際の計算過程を写していること
適応性・道具使用フィードバック、検索、検証、棄権、再計画単体モデルが環境を理解していること
SEPARATE QUESTION

理解と意識は別問題です。 「理解」を行動・表現・推論の操作的な概念として評価しても、それは主観経験、感情、自己意識の存在を証明しません。反対に、意識を定義しないまま、ベンチマークの正答から有無を推論することもできません。

「次トークン予測だから理解していない」はどこまで正しいか

次トークン予測は、LLMの学習目標を説明します。しかし、学習目標だけで学習後の内部表現や、入力に応じた一般化の仕方をすべて記述できるわけではありません。トークンで訓練されたモデルが、意味の同値類を単位にした確信を示せるかを調べる研究もありますが、それは特定のQA・サンプリング条件でのsemantic calibrationです。

Nakkiran et al. のICLR 2026研究は、意味クラスに対するB-calibrationを導入し、base LLMのsampling-basedな意味較正を分析しました。公式要旨が報告するinstruction tuningやchain-of-thoughtによる変化は、意味クラスとQA評価の結果です。ここから「人間のような意味理解」や「意識」を導くことはできません。

逆に、「次トークンを予測している」という事実だけから、すべての出力を局所的な暗記と呼ぶのも同じくらい射程が広すぎます。判断すべきなのは、学習目標のラベルではなく、未見の組合せ、介入、長期状態、誤り方、確信の更新が再現するかです。

ICLR 2026 / 査読済み conference poster

Trained on Tokens, Calibrated on Concepts

意味クラスで較正を定義する研究。token-levelの学習目標から、概念単位の確信を測る評価へ移るときの、可能性と条件を示します。

ICLR公式ページ ↗ ・ claim-level confidenceの解説へ

理解しているように見える証拠

肯定側の証拠は、単なる流暢さではなく、入力の表面を変えても関係構造を保てるか、環境の状態と介入結果を追えるか、静的ベンチマーク以外でも能力が現れるかで見ます。

COMPOSITION

未見の組合せへ一般化する

Han & Padóは、SCAN・COGS・GeoQueryを使い、in-context learning問題を学習上の誘因として与えると、設定した条件でcompositional generalizationが改善することを報告しました。これは「関係の組み合わせを扱える」証拠ですが、全般的な意味理解の証明ではありません。

LREC-COLING 2024 / ACL Anthology ↗

CAUSAL PLANNING

因果モデルを明示的に接続する

Gkountouras et al. は、因果表現学習とLLMを接続し、自然言語と因果変数を橋渡しする枠組みを提案しました。因果計画でLLMベースのreasonerを上回ったのは、LLM単体がすでに世界を理解したというより、明示的なcausal world modelを組み合わせた効果として読むべきです。

ICLR 2025公式ページ ↗

WORLD MODEL

テキスト環境の状態を予測する

査読前のFrom Word to Worldは、テキスト環境での次状態予測をworld modelとして定式化し、5環境で潜在状態の整合性とエージェント性能を評価しました。結果は環境の行動範囲と複雑さに依存し、現実世界のgroundingとは分けて扱います。

arXiv preprint(査読前) ↗

INTERACTIVE TESTS

静的スコア以外で差を見る

Momentè et al. は、標準ベンチマーク、interactive game、認知テストを比較し、モデルの差を識別する点ではinteractive gameが優れると報告しました。因果・論理推論は複数の評価と相関する一方、実行機能や社会・感情的能力では評価形式の差が現れました。

Findings of EMNLP 2025 / ACL Anthology ↗

AAAI 2025 / 査読済み conference paper

抽象的な関係を内部表現から検査する

Ni et al. はGeneralized Associative Recall(GAR)でcompositional relational reasoningを評価し、Vicuna-33Bのタスク間で再利用される回路と、true / falseの抽象概念を表すattention headのクラスを介入実験で調べました。内部表現を検査できることは重要ですが、特定のGAR課題の表現を人間の意味理解へ一般化しません。

AAAI公式ページ ↗

WHAT THIS SUPPORTS

これらの結果は、LLMが単純な文字列の暗記だけでは説明しにくい条件付き能力を示す、という主張を支えます。ただし、能力の存在から、人間と同じ内的経験・意識・感情を推論することは支えません。また、causal world modelの成功をLLM単体の内的世界モデルへ移すこともできません。

理解していないように見える証拠

失敗を「間違ったから理解していない」とは読みません。人間も間違うからです。重要なのは、どの概念に対して、どんな崩れ方をしたかです。表面の手掛かりへ依存するのか、複雑さで急に崩れるのか、説明と出力の因果がずれるのかで、反証される理解概念が変わります。

POTEMKIN

正答と概念表現が整合しない

Mancoridis et al. の査読前研究は、ベンチマークの正答だけでは、モデルが人間の解釈と整合する形で概念を扱ったか分からないと formalizeし、複数のモデル・課題・領域で「Potemkin understanding」を報告します。preprintの結果であり、すべての評価を無効にする定理ではありません。

arXiv preprint(査読前) ↗

SHORTCUT

パターンが変わると一般化しない

Lin et al. は、implicit reasoningが固定パターンのデータでは高精度になりうる一方、未固定パターンでは特定パターンへ過適合し、一般化に失敗することを報告しました。これはshortcut learningの証拠ですが、「すべての推論がshortcut」とまでは言いません。

Findings of ACL 2025 / ACL Anthology ↗

COMPLEXITY

問題の深さで急に崩れる

ZebraLogicは、論理課題の複雑さが増すと精度が下がり、その制限がモデルサイズや推論時計算量を増やしても残ると報告しました。NeurIPS 2025のcontrolled puzzle研究も、複雑さの閾値を越えると精度が崩れ、推論努力が逆に減る現象を報告しています。

ICML 2025 / PMLR ↗ ・ NeurIPS 2025 ↗

SOCIAL REASONING

心的状態の手掛かりに引っ張られる

Soubki & Rambowは、ToM研究16件を調べ、機械だけが利用しうるパターンの検証を行った研究が半数未満で、machine validationを行った研究では人間を超えたモデルを確認できなかったと報告しました。Kozachenko et al.も、明示的な心的状態の足場がある課題と暗黙推論で結果が異なり、語彙手掛かりが成績を動かすことを報告しています。

Findings of ACL 2025 ↗ ・ IWCS 2025 ↗

EMNLP 2025 / 査読済み conference paper

説明が流暢でも、faithfulnessは別に測る

Tutek et al. は、chain-of-thoughtに含まれる情報をモデルからunlearningし、予測が変わるかでparametric faithfulnessを測るFURを提案しました。4つのLMと5つのMCQAデータセットで、重要な推論ステップを消すと予測が変わる例を示しています。つまり、説明のfaithfulnessは検査可能な性質ですが、説明があること自体をfaithfulnessの証拠にはしません。

ACL Anthology / EMNLP 2025 ↗ ・ 推論前後の確信と説明を分ける

ベンチマークでは、何が測れているのか

ベンチマークは不要なのではなく、単独で「理解」の代理変数にしないことが重要です。ToMBenchは既存のToM評価について、範囲の狭さ、主観的判断、汚染を問題にし、8タスク・31能力・二言語の新規在庫を組み合わせました。それでも得られるのは、定義した社会認知課題の成績です。

Momentè et al. のtriangulationは、標準ベンチマーク、ゲーム、認知テストの相関が同じではないことを示します。NeurIPSのcontrolled puzzle研究は、既存の数学・コードベンチマークだけでなく、複雑さを操作できる環境、シミュレーター、内部traceを使いました。評価の数を増やすより、課題の表面を変え、正解ラベルと失敗の型を独立にすることが、理解に置く確信を強くします。

観測された結果支持できるclaimまだ言えないclaim
ベンチマーク高得点そのデータ・評価形式での能力人間と同じ概念表現、意識
未見組合せへの転移特定の構造を別の表面へ適用する能力すべてのドメインでの抽象化
因果計画の成功定義した環境での状態予測・計画外界全体をgroundedに理解していること
CoTの説明検証対象となる言語的trace内部計算を完全に写した自己報告
RAGの根拠支持参照資料とclaimのfaithfulnessモデル内部の意味理解や知識の所有
高いconfidence較正できれば、同条件の正解頻度との対応理解の深さ、意識、説明の真実性
CITATION-TO-CLAIM AUDIT

引用が同じテーマを扱っているだけでは不十分です。ToMの失敗研究を「LLM全般に推論能力がない」の根拠にしない。hallucination検出を「意味理解がない」の根拠にしない。ベンチマーク高得点を意識の根拠にしない。このページでは、各研究の条件・評価単位・限界をclaimの直後に置きます。

ACL 2024 / 査読済み benchmark paper

ToMBench: Benchmarking Theory of Mind in Large Language Models

ToMを8タスク・31能力で評価し、既存評価の汚染と範囲の問題を明示した研究です。結果は「人間のようなToMがある/ない」の最終判定ではなく、心的状態の帰属課題をどう設計するかの材料として使います。

ACL Anthology ↗

calibration・reasoning・groundingは、理解とは別の軸

CONFIDENCEの既存ページは、理解を一つのスコアにまとめるためではなく、判断を分解するためにあります。正しい答えを出す能力があっても、確信を適切に見積もれるとは限りません。根拠を引用できても、その根拠がclaimを支持するとは限りません。推論traceが整って見えても、内部計算のfaithfulnessは別に検証する必要があります。

ここで聞く問い測るもの次に読む
答えの確信は正しいかconfidenceと正解頻度の対応、ECE、Brier、selective riskLLMの較正
考えた後に確信は更新されたか推論前後、過信、反証への更新、確信推定器reasoning modelの確信度
長文のどの部分が危ういかatomic claim、semantic uncertainty、coverage-riskclaim-level confidence
外部資料は回答を支持するかKB scope、evidence status、faithfulness、拒否・再検索RAGの不確実性ルーティング
会話の途中で整合するかターン別較正、情報の追加、長期的一貫性マルチターン較正
自分のデータで照合できるか信頼性図、bin / group / split、threshold、AUGRC信頼性図ツール
OPERATIONAL RULE

理解を主張したいなら、まず理解の定義、評価分布、独立した正解、失敗の型、確信の取得方法を固定します。較正が良いから理解している、RAGで出典があるから理解している、reasoningが長いから理解している、という短絡をしません。

Future Lens:2126年から2026年の前提を見る

Future Lensは未来を当てるための欄ではありません。現在の前提、支持する証拠、説明できない亀裂、最強の反論、前提が変わる条件、そして見方を修正する観測を同じ画面に置く編集フレームです。

QUALITATIVE EDITORIAL SCALE

Evidence strength: Moderate / Social adoption: High / Change pressure: High / Forecast uncertainty: Very High

これは統計量や確率ではなく、研究の条件、実務での浸透、前提を変える圧力、未来の不確実性を分けて読むための定性的な編集評価です。

NOW / 2026

現在の安全な前提

LLMには、言語の整合、未見課題への転移、因果・計画、道具使用など、条件付きで測れる能力がある。一方で、その能力は課題・分布・モデル・評価形式に依存し、理解という単語だけで一括しない。

EVIDENCE

前提を支えるもの

composition、因果的な状態予測、interactive task、意味クラスの較正、説明の因果検査。単なる流暢さより、表面を変えても関係が保たれる証拠を重く見る。

CRACKS

前提では説明しにくいもの

shortcut、benchmarkの機械的手掛かり、complexity cliff、長期的な不整合、根拠とclaimのずれ、CoTの非faithfulness。これらは「理解ゼロ」ではなく、特定の理解概念への反証として読む。

COUNTERCASE

最強の反論

人間の理解も、間違い、近道、記憶、道具、訓練分布に支えられている。したがって、身体性や主観経験を満たさないからといって、機能的な理解を認めないのは人間中心的な基準かもしれない。問題は、機能的理解をどこまで一貫して再現できるかだ。

SHIFT / SCIENCE & TECH

科学・技術が変える条件

汚染耐性のあるinteractive benchmark、介入に耐える内部表現、長期環境でのworld state、分布外でも較正されたconfidenceが、複数モデル・複数領域で再現されること。逆に、失敗が偶然ではない一般則として整理されることも前提を変える。

SHIFT / INSTITUTIONS

社会構造・制度が変える条件

教育・医療・行政などで、答えの正しさだけでなく、根拠、拒否、監査ログ、責任分担、異議申立てが制度化されること。社会が「理解」という語を性能ラベルではなく監査可能な契約として使うこと。

SHIFT / VALUES

価値観・定義が変える条件

「理解」を内面の再現ではなく、他者と環境に対して説明可能で、反証に更新し、失敗時に止まれる関係能力と定義するのか。それとも意識・身体・経験を不可欠とするのか。定義の違いを隠さないことが先にある。

2126 / THOUGHT EXPERIMENT

未来から見た2026年

2126年の研究者が2026年を振り返るなら、LLMの「理解」を一つの発見としてではなく、複数の評価対象を一語で呼んでいた移行期として記述するかもしれません。これは仮説・思考実験であり、予測や確率ではありません。未来の判定は、現在の言葉ではなく、当時の評価データと定義の履歴に依存します。

FALSIFIER

何が起きたら見方を変えるか

次の観測が揃えば、現在の慎重な見方を更新します。反証側: 汚染耐性のある複数領域・長期・interactive評価で、能力・状態追跡・因果更新・confidenceの較正が一貫して再現され、shortcutやcomplexity collapseが説明できる一般モデルが得られること。反証の反対側: 見かけの転移が評価形式を変えると消え、内部状態・行動・説明が長期にわたり整合しないことが複数研究で再現されること。

現時点で言えること/言えないこと

CAN SAY

言える

LLMは条件付きで、言語的な関係、未見の組合せ、計画、根拠に基づく応答、意味単位の確信などを示す。評価は操作的概念ごとに作るべきです。

CANNOT SAY

まだ言えない

その能力だけから、人間と同じ意味理解、一般的なworld model、意識、感情、主観経験を確定できる。benchmarkやCoTをそのまま内面の窓にもできません。

NEXT TEST

次に測る

分布を変えた課題、独立ラベル、因果介入、長期対話、evidence status、claim-level confidenceを組み合わせ、低確信時の再検索・人間移譲まで含めて検証します。

CONFIDENCE'S ANSWER

AIが理解しているかを一語で決めるより、理解と呼びたい性質を分解し、その性質に合う証拠だけへ確信を配る。 それが、2026年にできる最も誠実な答えです。

参照した一次情報

このページでは、主要な科学的主張の根拠として一般ブログやSNSを使っていません。主要参照15件(原著・benchmark等14件+survey 1件。うち査読前preprint 2件)を、査読済みの原著・conference paperと査読前preprintに分けて扱います。systematic review / meta-analysisは主要根拠として採用していません(ToMのsurveyはsurveyとして扱います)。

  • Han & Padó (2024), Towards Understanding the Relationship between In-context Learning and Compositional Generalization, LREC-COLING 2024. ACL Anthology ↗
  • Chen et al. (2024), ToMBench: Benchmarking Theory of Mind in Large Language Models, ACL 2024. ACL Anthology ↗
  • Gkountouras et al. (2025), Language Agents Meet Causality — Bridging LLMs and Causal World Models, ICLR 2025. ICLR proceedings ↗
  • Ni et al. (2025), Benchmarking and Understanding Compositional Relational Reasoning of LLMs, AAAI 2025. AAAI ↗
  • Lin et al. (2025), Implicit Reasoning in Transformers is Reasoning through Shortcuts, Findings of ACL 2025. ACL Anthology ↗
  • Soubki & Rambow (2025), Machine Theory of Mind Needs Machine Validation, Findings of ACL 2025. ACL Anthology ↗
  • Kozachenko et al. (2025), On the Role of Linguistic Features in LLM Performance on Theory of Mind Tasks, IWCS 2025. ACL Anthology ↗
  • Tutek et al. (2025), Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps, EMNLP 2025. ACL Anthology ↗
  • Momentè et al. (2025), Triangulating LLM Progress through Benchmarks, Games, and Cognitive Tests, Findings of EMNLP 2025. ACL Anthology ↗
  • Lin et al. (2025), ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning, ICML 2025. PMLR ↗
  • Shojaee et al. (2025), The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity, NeurIPS 2025. NeurIPS ↗
  • Mancoridis et al. (2025), Potemkin Understanding in Large Language Models, arXiv preprint(査読前). arXiv ↗
  • From Word to World (2025, revised 2026), Can Large Language Models be Implicit Text-based World Models?, arXiv preprint(査読前). arXiv ↗
  • Nakkiran et al. (2026), Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs, ICLR 2026. ICLR ↗
  • Farquhar et al. (2024), Detecting hallucinations in large language models using semantic entropy, Nature 630. Nature / DOI ↗

書誌情報・研究ステータス・claimの射程・掲載箇所・retraction / correction確認は、内部研究台帳(docs/RESEARCH_LEDGER.md)で管理しています。2026-09-04確認時点の整理であり、研究結果は各論文のモデル、データ、評価形式を越えて一般化していません。