QUICK READ

これは「正しさ」を自動認定する道具ではない

このページが見せるのは、与えられた行データの記述統計です。confidence が高いのに outcome が失敗だった箇所、tool_type ごとの偏り、前のステップからの上昇・下降を見つけ、再検証や人のレビューを置く候補を決めます。

データはサーバーへ送信せず、保存もしません。初期値は説明用の合成データであり、論文の実験値や特定モデルの性能を再現するものではありません。

01 / TRACE

どこで確信が動いたか

step 順に first / last、最大上昇、最大下降を確認します。

02 / SPLIT

tool_type で差があるか

検索・検証などを混ぜず、入力した分類ごとに粗く比較します。

03 / REVIEW

次に見る場所を決める

evidenceタグの行で前行より5ポイント超上昇した箇所をレビュー候補にします。

AUDIT INPUT

CSV または textarea から集計する

ヘッダーを含む CSV を貼り付けてください。必須列は step, confidence, outcome, tool_type, stage の5列です。confidence は0〜1、outcome は0(失敗)または1(成功)で入力します。

利用できる tool_type は none、evidence、verification、other です。1行目のヘッダー名は変更しないでください。

SUMMARY

全体の読み取り

—行数
—正解率
—Brier
—ECE / 5 bins
—平均 confidence

Brier は confidence と outcome の二乗誤差、ECE は5つの区間で平均 confidence と正解率の差を重み付けした記述値です。サンプル数が少ない比較や、異なるタスクを混ぜた比較は判断材料の一つに留めてください。

TOOL TYPE

道具の種類ごとに、確信と結果を分ける

同じ confidence でも、外部証拠を取りに行った行と、決定的な検証を通った行では意味が違う可能性があります。この表は、その仮説を点検する最初の分解です。

tool_type件数正解率平均 confidencecalibration gap
計算中…

calibration gap は「平均 confidence − 正解率」の符号付き差です。プラスだから直ちに危険、マイナスだから安全、という意味ではありません。

TRAJECTORY

上昇した確信が、結果に追いついたか

—最初の confidence
—最後の confidence
—最後 − 最初
—最大上昇
—最大下降

ステップ間の変化は因果関係を証明しません。evidenceタグの行で前行よりconfidenceが上がった場合も、ログ・出典・再現手順を別に確認します。

パターン件数この集計での定義
計算中…

evidenceタグの行で前行より5ポイント超の上昇

  • 計算中…

BOUNDARIES

このツールで言えないこと

言える

入力された行の範囲で、confidence・outcome・tool_type の記述的な差を確認できる。

まだ言えない

別モデルへの一般化、因果効果、論文ベンチマークの再現、将来の失敗確率を保証すること。

次に必要

タスク定義、独立した正解ラベル、ツール呼び出しと観測のログ、サンプル数、時間順の評価。

エージェントの不確実性は、回答の一つのスコアだけでなく、行動中の状態・道具・観測・時間にまたがります。研究上の整理はAIエージェントの不確実性を読む、既存の確率評価は信頼度ダイアグラム、複数ターンの変化はマルチターン較正も参照してください。