新着研究 / LLM
架空の固有名詞でも答えられるかを測る言語モデルの推論テスト
MemoReason
MemoReasonの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 2: Accuracy of Qwen3.5-27B, GPT-OSS-20B, and Claude Sonnet 4.6 as the proportion of entities replaced with fictitious ones increases. Dashed red lines show factual accuracy; orange shaded bands show 95% confidence intervals.
概要
- 事実版と、構造を保って固有名詞や数値を置換した架空版を対にして評価する。
- 著者らの9モデル評価では、答えが変わる推論問題で架空版の成績がすべて有意に低下した。
- 架空版の誤答は元の事実上の答えの単純な再生では説明しきれず、原因の切り分けが必要である。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、MemoReasonの仕組み
- 01事実の文書と質問
- 02固有名詞と数値を置換
- 03架空の文書で回答
- 04対の正答率を比較
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
言語モデルが文書に基づく質問へ正答しても、文書を読んで筋道を立てたのか、学習済みの知識が助けたのかは見分けにくい。「パラメータ記憶」は、学習で得た知識がモデル内部に残っていることを指す。
実務の文書には新しい名称や更新された日付が多い。既知の固有名詞での成績だけを見ていると、未知の情報を含む文書での弱さを見逃すおそれがある。
手法
MemoReasonはWikipediaの記事冒頭を基に、事実版の文書と質問・答えを作る。人物や場所、年、数値などに種類を付け、同じ種類の架空値へ置き換える。数値の合計や出来事の順序が崩れないよう規則を設け、同じひな型から架空版を複数作る。
例えば「計画開始から初飛行まで何年か」という問いは、事実版でも架空版でも年の引き算を要する。モデルへ両版を別々に答えさせ、正答率の差を測る。答えが置換で変わる問題、変わらない問題、文書だけでは答えられない問題も分けている。
新規性
MemoReasonは、同じ文書と質問の構造を保ったまま、人物・組織・年・数値などを架空の値へ置き換えた対を作る。推論に必要な操作を揃え、文書内容へのなじみだけを変えて正答率差を測ろうとする設計である。
さらに、架空版で失敗した回答が元の事実上の答えをそのまま出したかを調べる。著者らは、なじみのある情報による成績差と、記憶した答えへの単純な飛び付きとを分けて検討した。
従来手法との違い
通常の事実文書を使う質問応答テストでは、高得点が文書内の推論によるものか、学習時に見た内容へのなじみに助けられたものか分かりにくい。MemoReasonは、事実版と架空版で質問の型と必要な計算・推論を対応させる。
先行研究について著者らは、事実版と架空版で証拠と質問の組が異なると、その差自体が成績差を生む可能性を指摘する。本ベンチマークは同じひな型から対を作り、その問題を抑える。
実験結果
著者らのデータは100文書のひな型、各12問からなる事実版1,200問と、各ひな型を10通りに置換した架空版12,000問で構成される。算術、時系列、推論、文書からの抽出を含み、9モデルで回答を評価した。
答えが置換に応じて変わる推論問題では、9モデルすべてで架空版の成績が統計的に有意に低下した。表中の最大低下は推論分類の15.7ポイントである。架空版の誤答が対応する事実版の答えをそのまま返すことはまれだったと著者らは報告する。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:社内規程の質問応答モデルが、文書に書かれた条件を読んで判断しているかを調べる。入力は実在の部署名・日付・金額を含む短い規程文と、その値を整合性を保って置き換えた架空版の対である。
両版に同じ種類の計算や条件判断を問う質問を出し、回答と根拠箇所を保存する。出力は設問ごとの差分一覧で、架空版だけの誤りを文書読解や既知情報との衝突の観点から点検する。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:業務でよく使う文書から、計算や条件判断を要する質問を少数作る。元文書の人物・部署・日付・数値を同じ種類の架空値へ置き換え、合計や前後関係を人が確認する。
元版と架空版を同じ設定のモデルに解かせ、対ごとの正誤、根拠箇所、元の値を誤って答えた件数を記録する。単純な抜き出し問題も基準として含め、推論問題だけで差が大きいかを測る。
限界と課題
著者らは、架空版での成績低下を確認した一方、誤答が元の事実上の答えをそのまま返す例は少ないと報告する。したがって低下の原因を、単純な答えの丸暗記だけで説明することはできない。
編集上の確認事項は、架空の名前や数値が不自然になっていないか、置換後も文書の論理が保たれているか、対象業務での誤りが固有名詞へのなじみ以外の要因でも起きていないかである。
出典
元のタイトル・要旨を確認する(英語)
MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs
Large Language Models (LLMs) perform well on reasoning benchmarks, but it remains unclear whether this reflects genuine contextual reasoning or reliance on facts memorized in their parameters. We investigate this by distinguishing two possibilities: a broad \textit{memorization bias}, where familiar content improves reasoning performance, and the \textit{Strong Parametric Shortcut Hypothesis}, where models skip reasoning entirely and recall stored answers. To test these effects, we introduce \textbf{MemoReason}, a human-curated benchmark that pairs factual reasoning tasks with structurally identical \fictitiousterm{} versions where real entities like people, companies, or dates are systematically replaced by \fictitiousterm{} ones of the same type. This \scorerevision{preserves task structure and specified reasoning operations} while varying the familiarity of the context, allowing controlled measurement of how the parametric memory affects reasoning. \revision{Our evaluation of recent LLMs reveals consistent and statistically significant performance drops of up to 15.7\% in the fictitious setting, demonstrating a clear memorization bias.} However, a targeted analysis of \revision{questions failed in the fictitious setting} shows that models rarely respond with the corresponding factual answer, indicating that direct parametric shortcuts are not the dominant failure mode. These findings suggest that parametric memory influences reasoning through mechanisms more complex than simple factual recall. \textbf{MemoReason} provides a controlled framework for studying these mechanisms and for extending paired factual-fictitious{} evaluation to broader reasoning settings.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30