QUICK READ
これは「正しさ」を自動認定する道具ではない
このページが見せるのは、与えられた行データの記述統計です。confidence が高いのに outcome が失敗だった箇所、tool_type ごとの偏り、前のステップからの上昇・下降を見つけ、再検証や人のレビューを置く候補を決めます。
データはサーバーへ送信せず、保存もしません。初期値は説明用の合成データであり、論文の実験値や特定モデルの性能を再現するものではありません。
01 / TRACE
どこで確信が動いたか
step 順に first / last、最大上昇、最大下降を確認します。
02 / SPLIT
tool_type で差があるか
検索・検証などを混ぜず、入力した分類ごとに粗く比較します。
03 / REVIEW
次に見る場所を決める
evidenceタグの行で前行より5ポイント超上昇した箇所をレビュー候補にします。
AUDIT INPUT
CSV または textarea から集計する
ヘッダーを含む CSV を貼り付けてください。必須列は step, confidence, outcome, tool_type, stage の5列です。confidence は0〜1、outcome は0(失敗)または1(成功)で入力します。
利用できる tool_type は none、evidence、verification、other です。1行目のヘッダー名は変更しないでください。
SUMMARY
全体の読み取り
Brier は confidence と outcome の二乗誤差、ECE は5つの区間で平均 confidence と正解率の差を重み付けした記述値です。サンプル数が少ない比較や、異なるタスクを混ぜた比較は判断材料の一つに留めてください。
TOOL TYPE
道具の種類ごとに、確信と結果を分ける
同じ confidence でも、外部証拠を取りに行った行と、決定的な検証を通った行では意味が違う可能性があります。この表は、その仮説を点検する最初の分解です。
| tool_type | 件数 | 正解率 | 平均 confidence | calibration gap |
|---|---|---|---|---|
| 計算中… | ||||
calibration gap は「平均 confidence − 正解率」の符号付き差です。プラスだから直ちに危険、マイナスだから安全、という意味ではありません。
TRAJECTORY
上昇した確信が、結果に追いついたか
ステップ間の変化は因果関係を証明しません。evidenceタグの行で前行よりconfidenceが上がった場合も、ログ・出典・再現手順を別に確認します。
| パターン | 件数 | この集計での定義 |
|---|---|---|
| 計算中… | ||
evidenceタグの行で前行より5ポイント超の上昇
- 計算中…
BOUNDARIES
このツールで言えないこと
言える
入力された行の範囲で、confidence・outcome・tool_type の記述的な差を確認できる。
まだ言えない
別モデルへの一般化、因果効果、論文ベンチマークの再現、将来の失敗確率を保証すること。
次に必要
タスク定義、独立した正解ラベル、ツール呼び出しと観測のログ、サンプル数、時間順の評価。
エージェントの不確実性は、回答の一つのスコアだけでなく、行動中の状態・道具・観測・時間にまたがります。研究上の整理はAIエージェントの不確実性を読む、既存の確率評価は信頼度ダイアグラム、複数ターンの変化はマルチターン較正も参照してください。