AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

曲中の音を手掛かりに個別の楽器音源を探すStembed

Stembed

保存した記事を見る

概要

  • Stembedは混合音から複数の検索用表現を作り、ステムごとに候補を探す。
  • MoisesDBの3音源混合では、全件検索のR@1が56.8%で、CIR–MuQの23.6%を上回った。
  • 正解音源が登録されていない場合の知覚上の類似性は、今後確認が必要である。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、Stembedの仕組み

左から右へ読む
  1. 01楽曲の混合音
  2. 02複数の音の表現
  3. 03使用スロットを選択
  4. 04類似ステムを検索

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

Stembedは、複数の楽器や歌が重なった曲から、似た単独音源をライブラリ内で探す。単独音源はステムと呼ばれ、制作では欲しい音色の参照になる。混合音全体を一つの検索語のように表すと、目当ての一音だけを指定しにくい。

従来法では楽器の種類を先に選ぶと検索しやすいが、利用者が音を聞いてその分類を決める必要がある。曲中の成分ごとに候補を提示できれば、結果を聞きながら探せる。

手法

学習では、同じ曲の単独音源を組み合わせて混合音を作り、混合音から四つのスロットを得る。各スロットと元の単独音源の表現を重複なく対応付け、同じ音源なら近く、異なる音源なら離れるように学習する。この数値表現を「埋め込み」と呼ぶ。

利用時には元の単独音源がないため、各スロットの「使われている確率」から検索に使うものを選ぶ。選んだスロットとライブラリの音源を数値上の近さで並べ、スロットごとに候補一覧を返す。たとえば三つの音がある曲なら、三組の検索結果を見比べられる。

新規性

Stembedは、複数の音が混ざった曲を一つの検索用表現にまとめず、複数の「スロット」に分ける。スロットは曲中の成分を一つずつ表すための内部表現で、各スロットから別々の音源候補を検索する。

学習時には混合音のスロットを元の単独音源と対応付け、同じ音源の表現を近づける。同時に、各スロットが実際に使われているかを予測し、利用時に音源数を指定せず候補を選べるようにした。

従来手法との違い

CIR系の基準法は混合音全体を一つの表現にし、楽器の種類を指定して検索すると成績が上がる。Stembedは複数の表現を出すため、種類を事前に指定しない全件検索でも、別々の楽器音を検索候補として扱える。

著者らは、単独音源を先に分離してから検索する方法や、複数の出力表現を教師の表現に近づける方法も比較した。ただし、学習目的など構成が異なる比較もあり、差をスロットだけの効果と断定はできない。

実験結果

著者らはMoisesDBで、テスト側のアーティストを学習側から分けた。3音源の混合1,536件から4,608件の検索対象を作り、2,068音源の全件検索を評価した。R@1は正解音源が各対象の検索結果の1位に入る割合である。

全件検索のR@1はStembedが56.8±0.9%、CIR–MuQが23.6±0.5%。音源数を自動推定したStembedは56.0±1.3%で、CIR–MuQを楽器群で絞った52.4%も上回った。ただし対象スロットの対応付けには、評価時に正解音源を使う手順が含まれる。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:音楽制作者が参考曲の「この背後の鍵盤に近い音」を探す際、曲の短い部分を入力して複数の検索結果群を出す。各結果群に付いた音源名やタグを見て目的のスロットを選び、候補音を試聴する。

出力は新しい楽器音そのものではなく、ライブラリ内の単独音源の順位である。楽器の種類を言葉で正確に指定しにくい場合の探索を支援する使い方だ。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:手元で利用できるステム付き楽曲を、アーティスト単位で学習用と評価用に分ける。CIR型の一つの表現による全件検索を基準にし、同じ音源ライブラリでStembedの各スロットによる検索と比べる。

正解音源のR@1とR@5に加え、制作者がタグを見て目的のスロットを選べる割合を測る。正解音源が登録されていない曲も別に試し、試聴での類似性を評価する。

限界と課題

著者らの評価は、正解の単独音源が検索先に含まれる条件で、その音源を何位で見つけるかを測る。実制作で重要な「別の曲の音でも似て聞こえるか」は、この順位だけでは分からないと著者らは述べ、知覚上の類似性を今後の課題とする。

編集上の確認事項は、ライブラリの収録内容が用途に合うか、密度の高い曲でもスロットを選びやすいかである。音源数の自動推定には、4音源の混合を少なく数える傾向が報告されている。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

Retrieving Individual Stems from Music Mixtures with Slot Embeddings

Music producers search libraries of isolated instrument recordings, called stems, for sounds resembling parts of an existing song. Neural retrieval systems address this by mapping audio to embeddings and ranking library stems by their similarity to the query. The leading method, Contrastive Instrument Retrieval (CIR), encodes the mixture as a single embedding, but it works best when a user specifies the target's instrument family. We introduce Stembed, which encodes a mixture as several slot embeddings representing candidate stems. During training, we construct mixtures from stems of the same song and match their slot embeddings to those of the isolated stems. The slot embeddings from mixtures inherit the stem identities of their assigned solo embedding, enabling a contrastive loss. On mixtures from held out MoisesDB artists, Stembed outperforms a CIR-style baseline when both search the full stem library. Even when predicting the stem count itself without family labels, Stembed exceeds the baseline's family-filtered R@1. Our website demonstrates how users can select a slot by inspecting the tags of its retrieved stems.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30