AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

文章を生成せず評判を数値化――Jevの選択・判定を組み合わせた感情分析

Jev Typed Decisions for Dimensional ABSA

保存した記事を見る

概要

  • Jevの点数、選択確率、二択判定を組み合わせ、文章生成なしで三つの観点別感情分析課題を解く。
  • 基盤モデルは更新せず、CPUで学習した488個の係数で判定を注釈基準に合わせる。
  • 著者らは十コーパスの数値予測でRMSE 1.0645、二つの抽出課題でcontinuous F1 52.09と44.06を報告した。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、Jev Typed Decisions for Dimensional ABSAの仕組み

左から右へ読む
  1. 01レビュー文
  2. 02語句候補の抽出
  3. 03関係と感情の判定
  4. 04語句組と数値

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

観点別感情分析は、文章全体の印象ではなく、「部屋」「価格」などの対象ごとに意見を捉える方法である。この研究の対象課題では、好意の度合いを表す感情価と、落ち着きから高ぶりまでの覚醒度を連続値で予測する。

実務では数値だけでなく、どの語句が何を評価したかも必要になる。文章を生成して結果を出す方法が広がる中で、決まった形式の判定を組み合わせても精度を得られるかを著者らは調べた。

手法

Jevに、選択肢の確率、はい・いいえの判定、段階別の点数を返す質問を行う。既に評価対象が与えられる課題では感情価と覚醒度をそれぞれ尋ね、学習データで求めた補正係数を使って1~9の数値へ合わせる。例えば「部屋は広い」なら、文章全体でなく「部屋」に向けられた評価を答える。

語句も探す課題では、各語が対象や意見の始まり・続き・その他のどれかを判定して候補を作り、語句の境界と対象・意見の関係を追加で確かめる。候補を選び直す処理の後に感情の数値を付け、さらに分類が必要な課題では候補カテゴリの確率と学習データの頻度を合わせて決める。

新規性

この研究は、評価対象と意見表現を抜き出し、感情の強さを数値化し、分類名を付ける三課題を、文章生成なしの型付き質問で構成した。型付き質問とは、点数、選択肢の確率、はい・いいえなど、答えの形式をあらかじめ定めた問いである。

基盤モデルJevの重みは更新せず、CPUで学習した488個の係数で出力を注釈基準に合わせる。候補となる語句の境界に関する複数の手掛かりを組み合わせる点も特徴だ。

従来手法との違い

比較対象には、調整したLlama-3.3-70BとGPT-OSS-120Bを使う生成型の基準モデル、およびSemEval参加システムがある。著者らの方式は文章を生成せず、候補の抽出、組の判定、数値の補正で答えを組み立てる。

十コーパスの数値予測では参加システム中で最小の集計誤差だった。一方、語句の組と分類まで抜き出す二課題では、上回る参加システムがある。モデルや教師データの使い方も異なるため、結果だけで文章生成の有無による差とは断定できない。

実験結果

著者らはSemEval-2026 Task III Track Aの六言語、十コーパスで数値予測を評価し、RMSE 1.0645を報告した。RMSEは予測値と正解値の差をまとめる指標で、小さいほどよい。語句の組と分類を扱う八コーパスでは、それぞれcontinuous F1が52.09と44.06だった。

比較表では、調整済みLlama-3.3-70BとGPT-OSS-120Bの両基準モデルを二つの抽出課題で上回った。構成要素を外す試験では、数値補正を外すとRMSEが2.0731となり、候補の選び直しを外すと語句の組の一致度が56.55から41.24へ下がった。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:日本語の宿泊施設レビューを入力し、評価対象の語句、意見の語句、好意の度合いと感情の高まりを出す。担当者は語句の組と数値を確認し、設備や接客に関する改善項目へ振り分ける。

「部屋は広いが朝食は残念」のように一文内で評価が分かれる場合、レビュー全体に一つの感情を付けるより、対象ごとの確認がしやすい。出力の境界や分類名を担当者が修正できる画面を前提にする。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:自社レビューから少数を選び、評価対象、意見表現、感情価、覚醒度を人手で付ける。比較の基準には、レビュー全体に感情を付ける方法と、語句の候補を単純に選ぶ方法を置く。

数値のRMSEに加え、対象と意見の語句が正確に一致する割合を測る。誤りを「候補なし」「候補はあるが未選択」「語句の境界違い」に分け、補正や候補選択を調整する価値を判断する。

限界と課題

著者らの誤り分析では、正解の語句の組の21.7%が候補に入らず、26.8%は候補に入っても選ばれなかった。感情の数値を正解に置き換えた場合の抽出指標の上積みは約4.5点で、主な残存誤差は語句の抽出にあると報告する。

編集上の確認課題は、自社レビューで語句の境界や分類の付け方が一致するか、質問を何度も行う構成の処理時間と費用である。著者らも、生成方式との時間・費用の同条件比較を今後の課題に挙げる。

研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

Decide, Don't Generate: Competitive Dimensional ABSA with Jev's Typed Decisions

Aspect-based sentiment analysis (ABSA) has largely turned to text generation. We show that competitive dimensional ABSA does not need it. Using Jev, a frozen model that answers typed questions with rubric scores, label probabilities, and yes/no judgments, we decompose all three tasks of SemEval-2026 Task III Track A into such decisions and align them with the annotation scheme through 488 coefficients fitted on CPU, with no text generation and no backbone tuning. On valence-arousal regression over ten corpora in six languages, the system reaches 1.0645 RMSE, the lowest aggregate error of any participating system. On triplet and quadruplet extraction, it reaches 52.09 and 44.06 continuous F1, above fine-tuned Llama-3.3-70B and GPT-OSS-120B baselines. Analyses and ablations show where the accuracy comes from: supervised calibration roughly halves the raw regression error, exact valence-arousal would add only 4.5 F1 to extraction, and the learned combination of span-boundary evidence, not any single signal, carries the extraction systems.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30