ROUGE を使って生成テキストを評価する
質問応答データセット(Softage-AI/sft-conversational_dataset)から 10 件のサンプルが与えられています。
これらのサンプルに対して TinyLlama-1.1B を用いて回答を生成しました。あなたのタスクは、生成結果の品質を正解と比較して評価することです。
このモデルが生成した回答は test_answers に、正解は reference_answers に用意されています。ROUGE 評価指標を用いて、モデルの生成品質を評価してください。
この演習はコースの一部です
Llama 3 のファインチューニング
演習の手順
- 評価用のクラスとメトリクス(ROUGE メトリクス)をインポートします。
- 評価クラスをインスタンス化し、ROUGE メトリクスを読み込みます。
- 与えられた
reference_answersとtest_answersを使って、評価インスタンスを実行し、ROUGE スコアを計算します。 final_scoreには、参照回答と生成回答の間で単語ペアの重なりを確認する結果のスコアを保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)