AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

言語モデルの「自分を知る力」を四つの観点から測るAwarenessBench

AwarenessBench

保存した記事を見る
原論文の図

AwarenessBenchの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 1: Model performance on AwarenessBench . Latest LMs are constantly breaking records.

出典:AwarenessBench / arXiv ↗

概要

  • 14,381問を四観点・15機能に分け、言語モデルの認知に関わる振る舞いを測る。
  • 18モデルの総合点は45.8~66.1で、人間比較には別の153問の部分集合を使った。
  • 高得点は意識の存在を示すものではなく、業務では機能別の失敗を確認する必要がある。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、AwarenessBenchの仕組み

左から右へ読む
  1. 01認知課題の質問
  2. 02言語モデルが回答
  3. 03機能別に採点
  4. 04四観点の得点を集計

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

AwarenessBenchは、言語モデルが自分の答えの確かさや、他者の考え、周囲の状況をどう扱うかを測る評価方法である。「メタ認知」は自分の判断を点検する能力を指す。これらを単一の正答率だけで捉えると、弱い機能が見えにくい。

実務のAIでは、正しい答えを出すことに加え、知らないことを認めたり、会話の含みを読んだりする振る舞いが求められる。著者らは、広く使われる言語・推論指標とは別に、こうした機能を分けて測る必要があると考えた。

手法

問題はメタ認知、自己、社会、状況の四つの観点に分かれ、その下に15の機能がある。たとえば自己評価では回答と確信度を求め、実際の正誤と確信度が合うかを調べる。知識境界では、解けた問題を「解ける」と判断し、誤答した問題を「分からない」と判断できたかを見る。

各機能の得点を観点内で平均し、最後に四観点を同じ重みで平均する。通常は正答率を使うが、理由として挙げた条件の過不足、確信度のずれ、同じ自己説明への回答の安定性などは別の尺度で採点する。したがって総合点は、単純に全問の正答数を割った値ではない。

新規性

著者らは、認知に関わる振る舞いをメタ認知、自己、社会、状況の四つの観点に整理し、15機能・14,381問の評価セットにした。既存の課題を調整したものと、新たに設計した課題を組み合わせている。

人間の三集団との比較に加え、一般的な言語能力や推論能力の指標と結果を比べた点も特徴である。総合点だけでなく、何を得意・不得意とするかを機能別に見られるようにした。

従来手法との違い

従来の関連評価は、ウェブ上の社会的判断や自己についての回答など、個別の現象を扱うものが多いと著者らは整理する。AwarenessBenchは四つの観点を同じ枠組みで測り、比較可能な得点を作る。

著者らの分析では、一般的な言語能力の指標が近いモデルでも、AwarenessBenchの総合点が大きく異なる例があった。DeepSeek-R1とQwen3-235B-A22Bは、参照した言語能力の順位指標がほぼ同じ一方、総合点に24.2点の差があったという。

実験結果

著者らは18の言語モデルを14,381問で評価し、総合点は45.8~66.1だったと報告する。最高はGemini-2.5-Proの66.1で、総合点の範囲内でも機能別の得意不得意は異なった。モデルは多くの機能で無作為回答の基準を上回った。

人間比較では、36人を高校生、博士課程学生、IT技術者の各12人に分け、153問の部分集合を用いた。技術者群の平均は66.7、最良モデルはその集合で66.8だった。一方、中央値のモデルはメタ認知と自己の観点で人間群より低いと著者らは報告する。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:社内の質問応答AIを選ぶ際、回答の正しさに加えて「分からない」と判断できるかを調べる。入力は答えられる質問と答えにくい質問を混ぜた社内向けの検証問題で、出力は回答、自己申告の確信度、回答可能かどうかの判断とする。

担当者は実際の正誤と自己申告を照合し、誤答に高い確信を示す例を調べる。AwarenessBenchの知識境界と自己評価の考え方を参考にした用途別評価であり、この論文が社内システムでの効果を実証したものではない。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:候補モデルに同じ業務質問を与え、正答、確信度、回答可能かの自己判断を記録する。基準には現在使うモデルを置き、単なる正答率と、誤答を高い確信で示した割合を並べて比較する。

さらに、利用者の意図を含む短い対話と状況が変わる課題を少数用意し、社会・状況の判断も個別に見る。総合点が近いモデルでも失敗の種類が違う可能性があるため、機能別の結果と実際の業務上の重要度を照合する。

限界と課題

著者らは、意識そのものには統一的な定義がなく、直接測ることが難しいため、課題上の「気づき」に関わる認知能力を評価対象にしたと説明する。得点が高いことは、主観的な意識の存在を証明しない。

編集上の確認点として、人間比較は全14,381問ではなく153問の部分集合で、移せない機能などを除外していることに注意したい。また、回答形式や問題文への慣れが得点へどう影響するか、実務で重要な失敗と各機能の得点が結び付くかは用途ごとに調べる必要がある。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

AwarenessBench: Assessing Cognitive Capabilities of Language Models

As language models (LMs) exhibit increasingly consciousness-like behaviors, evaluating their cognitive abilities becomes essential. We introduce AwarenessBench, the first comprehensive benchmark for assessing the cognitive abilities of LMs in four dimensions: metacognition, self-awareness, social awareness, and situational awareness, covering 15 cognitive functions and 14,381 samples. Evaluating 18 state-of-the-art LMs, we find that all consistently surpass random baselines, with more advanced models performing better. We further compare LMs with human performance across three demographic groups, where the best-performing model surpasses human averages overall, but most still fall markedly short in metacognition and self-awareness. Finally, we show that awareness is a distinct capability: progress in language modeling or reasoning does not necessarily translate into improved cognition.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29