新着研究 / LLM
多言語LLMでは全注意層を最初に置くと学習が速まるか
Multilinguality in Hybrid Attention LLMs
Multilinguality in Hybrid Attention LLMsの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 2: SoftCKA scores for Granite models, with hidden states taken at the beginning of each decoder layer ( attn_in ). Red dotted lines mark where full attention layers are in Granite H.
概要
- 英語と13言語の対訳表現を分析し、ハイブリッドLLMでは最初の全注意層付近に大きな変化を観察した。
- 全注意層数を固定した蒸留実験では、4つの代替配置が標準配置より速く損失を下げた。
- 既存モデルの比較には条件差があり、蒸留実験も10億トークン時点で未収束である。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、Multilinguality in Hybrid Attention LLMsの仕組み
- 01翻訳文と層配置
- 02層別の類似度測定
- 03配置を変えて蒸留
- 04多言語損失の比較
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
この研究は、再帰型の注意層と全注意層を組み合わせるLLMが、多言語の文章を内部でどう処理するかを調べる。全注意は文章中の各位置から以前の語を直接参照できる一方、文章が長くなると計算量が急増する。再帰型は過去を圧縮した状態として持ち、長文処理を軽くする。
同じ内容でも言語によってトークン数、つまりモデルが扱う文字列の断片数が増える。著者らの並行文での推計では、Qwen3.5のヨルバ語は英語の2.6倍だった。長文を扱えることに加え、必要な情報を取り出せることが多言語利用では重要になる。
手法
まず、同じ内容を異なる言語で書いた文をモデルへ入力し、各層の内部表現を比べる。SoftCKAは、言語間で語の切れ目が一致しなくても、語ごとの表現の似方から共通性を測る指標である。著者らはFLoResの英語と13言語の対訳を使い、最初の全注意層付近で共通性がどう変わるかを追った。
次に、全注意モデルを教師にして、注意層の一部を再帰型のGated DeltaNetに替えた生徒モデルを学習する。蒸留とは、教師の次の語の予測分布に生徒を近づける学習である。例えば4層ごとの末尾に全注意層を置く構成と先頭に置く構成を、全注意層数をそろえて比較し、各言語で教師との差と予測損失を測った。
新規性
再帰型の層と全注意層を混ぜたLLMについて、翻訳文の内部表現が層ごとにどう変わるかを調べ、最初の全注意層の周辺で大きな変化を見いだした点が新しい。多言語性能を最終スコアだけで比べず、処理の途中を観察している。
さらに、全注意層の数を固定して配置だけを変えた蒸留実験を行った。最初に全注意層を置く設計が有利という見方を示すが、提示された結果は事前学習全般への証明ではない。
従来手法との違い
通常の配置は、再帰型の層を3層置いた後に全注意層を1層置く周期的な構成である。著者らは、各4層の先頭を全注意にする配置と、全注意層を両端などに配る3種類を比べた。Qwen3-4Bでは全36層中9層、Granite-4.1-3Bでは全40層中10層という全注意層の数を維持している。
既存モデルの観察では、近い非ハイブリッドモデルとも比較した。ただしモデル間には規模、訓練時期、学習データなどの違いがあり、既存モデルの差だけから層の配置の効果を断定できない。配置を変える蒸留実験が、その問いをより直接に調べている。
実験結果
著者らは既存のハイブリッドモデル4組を分析し、最初の全注意層の周辺で言語間表現が大きく変わると報告した。長文検索のOneRULERでは、128K長の言語・課題評価をQwen3.5が40件中25件完了したのに対し、対応するQwen3は1件だった。ただしこの2モデルは規模や公開時期が異なる。
蒸留には英語30%と26言語を含むFineWeb2の標本を使い、10億トークンまで学習した。Qwen3-4Bから作った4つの代替配置は、標準配置が終点で得た交差エントロピー値へ約40%の学習量で到達したと著者らは報告する。交差エントロピーは次の語の予測損失で、低いほどよい。この結果は学習途中の比較である。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案。多言語の社内文書を読む長文対応LLMを新たに設計する場合、同じ全注意層数で「再帰型から始める配置」と「全注意から始める配置」を候補にする。入力は英語と対象言語で内容をそろえた文書、および各言語の長い検索用文書と質問とする。
出力は回答に加え、言語別の検索正答率、処理できた文書長、推論時のメモリ使用量を記録する。英語の平均値に埋もれやすい言語ごとの差を見ながら、層配置の変更が実務で扱う文書にも効くか判断するための応用案である。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案。同じ教師モデル、言語混合、全注意層数を使い、標準の周期配置と、各ブロックの先頭を全注意層にする配置の小規模な蒸留を行う。学習量ごとの検証損失を保存し、同じ値へ到達するまでに必要なトークン数を比べる。
並行して、対象言語ごとに短文と長文の検索課題を用意する。正答率、処理不能になった件数、推論時のメモリ使用量を英語と並べて確認する。全体平均だけで判断せず、実務で使う言語の一部だけが悪化していないかを採用条件に含める。
限界と課題
著者らは、比較した既存モデル同士が完全には対応していないこと、蒸留の各実行が10億トークンまでで収束していないことを明記している。最初の全注意層で起きる内部表現の変化も、モデルによって変化の向きが一致しない指標がある。すべての多言語課題で性能が上がるとは示していない。
編集上の検証課題は、長い文書からの検索精度と学習時の改善が同時に得られるかという点である。対象言語の分割効率や学習データの構成が変わっても結果が続くか、蒸留ではなく最初から学習したモデルにも当てはまるかは別に確かめたい。
出典
元のタイトル・要旨を確認する(英語)
Multilinguality in Hybrid Attention LLMs
In response to the growing demand for long sequences in agentic and reasoning use cases, many state-of-the-art LLMs combine multiple variants of attention to mitigate the quadratic complexity of traditional softmax attention. These hybrid attention LLMs aim to balance the strengths and limitations of full attention and alternatives based on recurrence. This work presents a first study of how hybrid attention impacts the multilinguality of LLMs. Beyond the impact on long sequences in poorly tokenized languages, our study is motivated by the possibility that the inductive biases of the recurrent state alter linguistic processing. Our interpretability analysis confirms this, showing that cross-lingual representations in hybrid models develop in patterns tied to the ordering of recurrent and full-attention layers. Across diverse models, we notably observe a pronounced spike in cross-lingual alignment around the first full-attention layer. These findings lead us to question the conventional ordering of attention layers. In distillation experiments on multilingual data, all alternative layer orderings outperform the standard throughout training, learning up to 2.5X faster. These stark, replicable results prompt our theory that multilingual models would benefit from starting with a full-attention layer rather than recurrent layers.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29