AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

文書を画像にして再順位付け、検索結果の精度と入力量を比べる

RenderRank

保存した記事を見る
原論文の図

RenderRankの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 1: Overview of conventional text-based reranking (left) and RenderRank (right) for the same query–document pair. RenderRank encodes rendered document images into visual tokens, which the language decoder processes with the textual query to compute a relevance score.

出典:RenderRank / arXiv ↗

概要

  • 文字文書を画像として表し、質問に対する関連度から検索候補を並べ直す手法である。
  • BEIRの11データセットで平均NDCG@10は55.96、入力は比較手法より16.5~35.5%少なかった。
  • 報告された処理量は視覚表現の事前計算を前提とするため、導入時は前処理を含む総時間を測る。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、RenderRankの仕組み

左から右へ読む
  1. 01質問と候補文書
  2. 02文書の画像化
  3. 03視覚トークン化
  4. 04関連度の採点
  5. 05候補の再順位付け

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

検索拡張生成(RAG)は、外部文書を探して回答の根拠に使う仕組みである。最初の検索が返す候補には関連の薄い文書も混ざるため、質問に合う順へ並べ直す「再順位付け」が必要になる。

ただし候補文書を一件ずつ読むため、文書が長いほど入力トークン数と処理負担が増える。文脈を切り捨てずに短い表現で関連度を判断できれば、根拠候補を選ぶ工程の効率を改善できる。

手法

候補文書の文字を一定の体裁で画像に描き、視覚言語モデルの画像処理部で視覚トークンへ変える。質問は文字として入力し、モデルが質問と各文書画像の関連度を一つずつ出す。長い文書は複数ページの画像に分け、順序を保って一つの候補として扱う。

学習の第一段階では、同じ文書を文字で読んだ教師モデルの得点に、画像を読むモデルの得点を近づける。第二段階では、同じ質問について関連文書の得点が非関連文書より高くなるよう調整する。例えば「出張費の精算期限」という質問なら、描画済みの規程候補を採点し、期限を扱う文書を上位へ送る。

新規性

RenderRankは、もともと文字として保存された候補文書を画像に描き直し、視覚トークンという画像由来の短い入力列から、質問との関連度を学ぶ再順位付け手法である。文書の画像表現は質問とは独立に先に計算できる。

学習を、文字入力の教師モデルが出す関連度への一致と、同じ質問に対する正例・負例の得点差の調整に分けた。表現を画像へ変えるだけでなく、関連度の判断を段階的に移す点が特徴となる。

従来手法との違い

従来の文字ベースの再順位付け器は、質問と候補文書を文字トークン列として入力し、一件ずつ関連度を採点する。RenderRankは質問を文字のまま保ち、文書側を画像から得た視覚トークンに置き換える。候補が多いほど、一件当たりの入力削減が積み重なる。

BEIRでの平均NDCG@10は55.96で、評価した4B未満の文字ベース手法を上回った。一方、表にある4BのQwen3-Rerankerは57.99であり、すべての比較手法より順位品質が高いわけではない。

実験結果

著者らはBEIRの11データセットで、BM25が取得した各質問の上位100文書を再順位付けした。上位10件の順位品質を測るNDCG@10の平均は55.96、質問と文書の一組当たりの入力は平均290.07トークンで、比較した文字ベース手法より16.5~35.5%少なかった。

長文の4データセットでは平均NDCG@10が88.27で、入力トークン数は比較手法の平均のおよそ半分、最高の比較処理量に対して1.70倍と報告する。処理量は視覚表現を事前計算し、GPU上の推論時間を測った条件である。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:社内規程を検索して質問に答える仕組みで、最初の検索が選んだ候補文書をRenderRankで並べ直す。入力は社員の質問文と、版が管理された規程文書の候補群である。

出力は質問との関連度順に並んだ文書と、その参照先である。上位文書を回答作成へ渡す前に、根拠となる条項が候補に残っているかを確認する。画像化した文書表現は、文書が更新された時点で作り直す。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:同じ社内文書群と質問集を使い、現在の文字ベース再順位付け器を基準にする。最初の検索が返した同一候補を両方式へ渡し、正しい根拠文書が上位10件に入る割合と順位を比べる。

入力トークン数に加え、画像化と事前計算、文書更新時の再処理を含めた総時間を測る。表や小さな注記を含む文書を別に確認し、順位が上がっても根拠の読み落としが増えないかを点検する。

限界と課題

著者らの処理量測定は、文書画像の視覚表現を事前計算した設定で、前処理や保存先からの読み出し時間を含まない。したがって報告された毎秒処理件数を、そのまま文書登録から回答までの所要時間にはできない。

編集上の確認点は、日本語文書や表、脚注、細かな文字で重要な根拠が読めるか、更新時の再計算費用、候補文書の切り詰めによる取りこぼしである。検索後の順位が良くても、最初の検索が正しい文書を拾えなければ補えない。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

RenderRank: Learning to Rerank Text with Compressed Visual Tokens

Rendering document text as images allows vision-language models to encode documents as visual tokens, which can reduce input sequence length compared with text input. This reduction in input length is particularly useful for reranking, where each query involves scoring multiple candidate documents and token savings apply to each candidate evaluation. We introduce RenderRank, a reranker that learns query-dependent relevance scoring from compressed visual document representations instead of the text token sequences used by conventional text-based rerankers. Training first aligns relevance scores from visual inputs with those of a text-based teacher, then refines the relative scores of positive and negative documents for the same query. Across 11 datasets from BEIR, RenderRank uses 16.5-35.5% fewer input tokens while achieving an average NDCG@10 of 55.96, outperforming all evaluated text-based baselines below 4B parameters and some larger models. Across four long-document datasets, it achieves an average NDCG@10 of 88.27 with approximately half the average input token count of the evaluated text-based rerankers. In this setting, RenderRank delivers 1.70x the highest average throughput of the evaluated baselines. These results demonstrate that compressed visual representations can support accurate document relevance scoring, providing an alternative to text token representations for reranking.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29