始める無料で始める

評価メトリクスの利用

カスタマーサポートのやり取りを分類するLLMを評価する時です。ファインチューニングしたモデルの後から、新しい検証データセットを使ってモデルのパフォーマンスを評価します。

一部の相互作用とそれに対応するラベルは、validate_textやvalidate_labelsとして読み込まれています。modelとtokenizerも装填されています。

この演習はコースの一部です

Python で学ぶ LLM の入門

コースを見る

演習の手順

  • outputs 内のモデルのロジットから予測ラベルを抽出します。
  • 実際のラベル(validate_labels)と予測ラベルを比較して、読み込まれた4つの評価指標を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
コードを編集して実行