評価メトリクスの利用
カスタマーサポートのやり取りを分類するLLMを評価する時です。ファインチューニングしたモデルの後から、新しい検証データセットを使ってモデルのパフォーマンスを評価します。
一部の相互作用とそれに対応するラベルは、validate_textやvalidate_labelsとして読み込まれています。modelとtokenizerも装填されています。
この演習はコースの一部です
Python で学ぶ LLM の入門
演習の手順
outputs内のモデルのロジットから予測ラベルを抽出します。- 実際のラベル(
validate_labels)と予測ラベルを比較して、読み込まれた4つの評価指標を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))