evaluate の評価指標を使う
カスタマーサポートのやり取りを分類する LLM を評価してみましょう。ファインチューニング済みモデルの続きとして、新しい検証データセットを使い、モデルの性能を確認します。
いくつかのやり取りとそれに対応するラベルは、validate_text と validate_labels として読み込まれています。model と tokenizer も用意されています。
この演習はコースの一部です
Pythonで学ぶ LLM 入門
演習の手順
outputsにあるモデルの logits から予測ラベルを抽出します。- 実際のラベル(
validate_labels)と予測ラベルを比較して、読み込まれている4つの評価指標を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))