新着研究 / LLM
生成文の「迷った箇所」を残し、回答の信頼度を見積もる
TRACE
TRACEの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 2: Overview of TRACE and TRACE+. Given a prompt and a decoded answer, TRACE extracts token-level surprisal and predictive entropy from the decoding trace, localizes risk through early/global, position-decayed, local-peak, and shape/length operators, and converts the resulting risk into a monotone confidence score. TRACE+ further standardizes trace features and applies a lightweight logistic calibrator to produce a calibrated probability.
概要
- 生成時の語ごとの不確かさを記録し、局所的な上昇を回答のリスク評価に使う。
- 4課題の主比較でTRACE+は平均Brier 0.137、AUROC 0.792を報告した。
- TRACE+の確率には正誤付き校正データが必要で、業務固有の質問で再検証する。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、TRACEの仕組み
- 01質問から回答生成
- 02語ごとの不確かさ記録
- 03局所リスク集計
- 04回答の信頼度
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
生成文の大部分が流暢でも、数字一つ、固有名詞一つ、事実の一節が誤れば回答全体は使えない。語ごとの確率を平均して一つの値にすると、短い重要箇所でモデルが迷った信号が、ほかの確信度の高い語に埋もれる。
実務では、回答を自動で採用するか人に回すかを決めるため、回答単位の信頼度が欲しい。追加生成を行わず、元の回答を変えずに、その生成過程から危うい箇所を拾えるかが課題となる。
手法
TRACEは、LLMが一度だけ回答を生成する間に、各語についてサプライザルと予測エントロピーを記録する。サプライザルは実際に選ばれた語の出にくさ、予測エントロピーは候補語への確率の散らばりである。語の順序を保った記録から、位置に応じた重み、局所区間の最大の山、文章長を考慮した値を組み合わせる。
例えば計算結果の最後の数字だけで候補が割れた場合、文章全体の平均では薄まるその揺れを局所リスクとして残す。TRACEはラベルなしで順位付けに使う信頼度を出し、TRACE+は別の正誤付きデータで学習したロジスティック回帰に軌跡特徴を入力して、回答が正しい確率へ変換する。回答文は変更しない。
新規性
TRACEは、生成中の不確かさを文章全体の平均にすぐ縮めず、どの位置で強まったかを使って回答単位のリスクを出す。単一回の生成結果をそのまま評価し、追加の回答生成や外部検証器を必要としない。
TRACE+は同じ記録から得た特徴を、別に確保した正誤付きデータで確率に校正する。ラベルを使わないTRACEの順位付け用スコアと、TRACE+の校正済み確率は用途を分けて解釈する。
従来手法との違い
比較対象には、生成語の平均確率、文章全体の尤度、平均エントロピー、局所窓の統計、ビーム探索の統計など19手法が含まれる。尤度は出力された語列の出やすさ、エントロピーは候補語への確率の散らばりを表す。
全手法が同じ生成済み回答を採点する条件で、TRACEは不確かさの局所的な山を残す。TRACE+の改善には確率への校正だけでなく、複数の軌跡特徴を使った順位付けの改善も含まれる。正しさを意味内容から直接検証する仕組みではない。
実験結果
著者らはMLQA、SVAMP、TriviaQA、TruthfulQAの4課題で、主比較にQwen2.5-7B-Instructを用い、19手法と比べた。Brierスコアは予測確率と正誤のずれで低いほどよく、AUROCは正答と誤答を信頼度で並べる性能で高いほどよい。TRACE+の平均はBrier 0.137、AUROC 0.792で、最も強い尤度基準の0.149、0.758を上回った。
別の7モデル、3課題の比較では、各指標で最良の非TRACE手法群に対し、平均Brierが0.136から0.120、AUROCが0.764から0.817となったと著者らは報告する。主比較は20回の校正・評価分割の平均である。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:社内規程に関する質問へLLMが回答し、金額や日付を含む文を返す業務を想定する。入力は質問と生成中の各語の確率分布、出力は回答文と回答単位の信頼度である。
信頼度が低い回答を担当者の確認待ちに送り、特に数値や固有名詞の付近で不確かさが上がった例を点検候補にする。採否の判断は別途行い、この方法の信頼度を根拠文書の正しさそのものと混同しない。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:まず既存の質問集から正誤が判定できる回答を確保し、生成文と語ごとの確率を同じ実行で保存する。校正用と評価用を分け、回答を変えずにTRACE+と文章全体の尤度を計算する。
Brier、AUROCに加え、低信頼の回答を人へ回したときの誤答見逃し率と確認件数を測る。数値・固有名詞を含む回答を別集計し、校正に使った質問と異なる期間の質問でも確率の意味が保たれるか確認する。
限界と課題
著者らの方法は、モデル内部の生成時確率を取得できることを前提とする。TRACEの生スコアは、そのまま「正しい確率」ではない。TRACE+には正誤ラベル付きの校正用データが要り、評価した質問群から別の業務へ移した場合の精度は本文の数値だけでは決まらない。
編集上は、短い回答と長い回答、数値を含む回答、社内固有の語を含む回答で校正が保たれるかを確認したい。また、低信頼と判定した回答を人が確認する運用が、見逃しと確認件数の両面で有効かを測る必要がある。
出典
元のタイトル・要旨を確認する(英語)
TRACE: Single-Pass Decoding-Trace Risk Localization for Generation Calibration
Reliable confidence estimation is essential for large language model deployment. However, answer-level calibration remains challenging because generation errors are often localized: a response may be fluent and high-probability overall while still failing at a critical number, entity, or factual claim. Existing estimators compress token probabilities, sequence likelihoods, entropy, or beam statistics into a global score, which can dilute such local risk signals. We propose TRACE, a single-pass, decoded-answer-preserving confidence estimator that treats decoding-time uncertainty as a trajectory through three steps: (i) recording token-level surprisal and predictive entropy during decoding, (ii) applying local risk operators to preserve uncertainty spikes, and (iii) converting localized trace risk into answer-level confidence. TRACE produces a label-free risk score, while TRACE+ calibrates trace-only features into probabilities using a held-out split, without extra generations or external verifiers. We evaluate four tasks against 19 calibration baselines, and TRACE+ reduces Brier from 0.149 to 0.137 and improves AUROC from 0.758 to 0.792 over the strongest likelihood baseline. Across seven LLMs, TRACE+ improves over the best non-TRACE baseline pool from 0.136 to 0.120 Brier and from 0.764 to 0.817 AUROC. Results show that localizing decoding-time risk provides a general approach to calibration.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29