ROUGE・BLEU・BERTScore の評価指標の違い
テキスト生成の代表的な評価指標を押さえます。
・ROUGE: 要約評価で、参照要約との語・n-gram の重なりを数える(表面一致ベース)。
・BLEU: 機械翻訳評価で、参照訳との n-gram の一致を見る(表面一致ベース)。
・BERTScore: 生成と参照を埋め込み(ベクトル)に変換し、意味的な近さで評価する(言い換えに強い)。
表面一致の ROUGE/BLEU は言い換えに弱く、意味的な近さで評価したいときは BERTScore を使います。