AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

文書画像を再処理せず、検索質問だけを小さなモデルへ蒸留する

ColNanoVDR

保存した記事を見る
原論文の図

ColNanoVDRの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 3: The ColNanoVDR pipeline. Training (top): the student outputs unit-norm query tokens { s i } \{s_{i}\} and token weights a ⁡ ( θ ) a(\theta) ; OTW (dashed box) aligns them with the cached teacher query tokens { t j } \{t_{j}\} by entropic optimal transport, and the loss is the soft alignment cost ⟨ P ε , C ⟩ \langle P^{\varepsilon},C\rangle . Inference (bottom): the teacher is discarded; weighted student tokens a i ​ s i a_{i}s_{i} are scored with standard MaxSim against the unchanged teacher index.

出典:ColNanoVDR / arXiv ↗

概要

  • 教師のページ索引を維持し、質問を処理する部分だけ1億4,900万パラメータの学生に置き換える。
  • 5種類の教師でViDoReの検索得点をおよそ95%維持し、質問符号化は最大約26倍速かった。
  • 学習時にページ画像を読まず、比較対象のスコア蒸留より保存済み教師データの読み出し量を12.6倍減らした。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、ColNanoVDRの仕組み

左から右へ読む
  1. 01学習用の質問文
  2. 02教師と学生の語表現照合
  3. 03学生の重みを学習
  4. 04既存索引の検索結果

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

視覚文書検索は、文字起こしを前提とせず、PDFなどのページ画像から質問に合うページを探す。高性能な方式では、質問とページを多数の小さなベクトルに分けて照合するため、検索のたびに大きな質問用モデルを動かす負担がある。

質問用モデルだけを小さくする「蒸留」は、教師モデルの表現を学生モデルに学ばせる方法である。しかし従来の複数ベクトル方式では、学習用ページも教師で処理して保存することが多く、文書側の負担が大きかった。

手法

教師と小型の学生は同じ質問文を、それぞれ複数のトークンベクトルに変える。トークンは文を分けた単位で、両モデルでは数や切れ目が違う。OTWと呼ぶ学習法は「最適輸送」で近いベクトル同士を柔らかく結び、一つの学生トークンが複数の教師トークンを代表できるよう重みも学ぶ。学習では教師の質問表現だけを使い、ページ画像を読まない。

検索時は学生が質問のベクトルと重みを出し、教師が以前作ったページ索引と照合する。各質問トークンについてページ内で最も近い表現を探し、得点を合わせる方式をMaxSimという。たとえば「売上の地域別推移」という質問から、関連する表や説明を含むページを上位に並べる。

新規性

著者らが提案する前進は、複数のベクトルで検索する画像文書システムでも、学習時に文書ページを読まず、質問側だけを小型化できる点である。異なる分割方法で作られた教師と学生の質問トークンを、重み付きの最適輸送で対応づける。

学生が出す各トークンの重みも質問から学習する。著者らは、この対応づけの費用から任意のページに対する検索スコア差の上限を示し、見ていないページへの適用を理論面から支える。

従来手法との違い

基準は、教師モデル自身の検索結果と、ページ画像を使って教師の検索スコアをまねる学習方式である。ColNanoVDRは教師の文書索引をそのまま使い、質問の符号化器だけを置き換えるため、既存ページの索引を作り直さない。

同じ学生と学習条件で比べると、OTWはページを使うスコア蒸留に近い検索精度を示し、学習中に読む保存済み教師データは12.6分の1だった。この節約は主に保存量と読み出し量で、学習計算が同じ割合で速くなるという結果ではない。

実験結果

著者らは5種類の教師から各1億4,900万パラメータの学生を作り、ViDoRe v1~v3のNDCG@5で評価した。NDCG@5は上位5件の順位の良さを測る指標で、学生は教師の得点のおよそ95%を保った。ColQwen3.5由来の学生はv3で55.1、教師は58.7だった。

質問の符号化だけを単一CPUスレッドで測ると、学生は87ミリ秒、教師は2,290ミリ秒で約26倍速かった。同一条件の学習比較では、ページを使うスコア蒸留に近い結果を、ページの符号化なしで得た。これらは索引検索を含む全工程の速度ではない。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:図表やレイアウトを含む社内のPDFページ画像を検索し、質問に合うページを担当者へ提示する。入力は日本語などの短い質問文と、既存の教師モデルで作ったページ索引で、出力は関連ページの順位付き一覧である。

文書索引は維持し、質問を処理する部分だけ学生モデルへ替える。担当者は上位ページを開いて答えを確認する。ページ画像を読まずに学習できる利点は、教師モデルを替えるたびの学習用ページ処理の負担を比較すると分かりやすい。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:既存のページ索引を固定し、教師の質問用モデルを基準に、学生へ替えたときの検索順位を測る。実際の質問と正解ページを用意し、上位5件に目的のページが入る割合、NDCG@5、質問の符号化時間を記録する。

表、図、長い文書など検索対象ごとに差を確認する。学習ではページを使わなくても、索引自体は教師が作ったものを利用するため、その作成・更新の負担は別に集計する。総応答時間も測り、小型化の効果が利用者に届くか確認する。

限界と課題

著者らの評価はViDoReの検索課題と質問の符号化時間に基づく。上位ページの順位が近くても、その後の回答生成の正確さや、組織固有の文書での性能が保証されるわけではない。また、ページ索引を使った検索処理全体の待ち時間と、質問符号化だけの時間は区別が必要である。

編集上の確認事項は、自社文書の言語、図表の形式、長い質問で順位が保たれるかである。教師の索引形式と学生の出力が合うこと、索引の保存量や更新手順も実運用で点検したい。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

ColNanoVDR: Document-Free Query Distillation for Multi-Vector Visual Document Retrieval via Optimal Transport

Multi-vector retrievers built on vision-language models lead visual document retrieval (VDR), but they run a multi-billion-parameter query encoder on every search. Distilling this encoder into a small student that queries the teacher's existing index would remove the bottleneck. The standard recipe, however, matches the teacher's MaxSim scores and so requires encoding and caching every training page, which can reach terabytes of page tokens. NanoVDR avoids pages entirely by training on the teacher's query embeddings alone, but only for single-vector retrievers. We present ColNanoVDR, to our knowledge the first framework to bring this document-free distillation to multi-vector VDR. Its objective, OTW (Optimal Transport with Learned Weights), aligns the student's query tokens with the teacher's by entropic optimal transport, with a learned weight for each student token, and needs no correspondence between the two tokenizations. We prove that the resulting alignment cost bounds the MaxSim score difference on every page. Distilled from five state-of-the-art teachers, the 149M text-only students retain about 95% of their teachers' NDCG@5 on ViDoRe v1-v3 while encoding queries up to 26x faster. Under identical training, OTW matches score distillation while encoding no page and reading 12.6x less cached teacher data.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29