読み込み中
Q2未挑戦の問題問題を見る

ROUGE・BLEU・BERTScore の評価指標の違い

テキスト生成の代表的な評価指標を押さえます。
ROUGE: 要約評価で、参照要約との語・n-gram の重なりを数える(表面一致ベース)。
BLEU: 機械翻訳評価で、参照訳との n-gram の一致を見る(表面一致ベース)。
BERTScore: 生成と参照を埋め込み(ベクトル)に変換し、意味的な近さで評価する(言い換えに強い)。
表面一致の ROUGE/BLEU は言い換えに弱く、意味的な近さで評価したいときは BERTScore を使います。