始める無料で始める

evaluate の評価指標を使う

カスタマーサポートのやり取りを分類する LLM を評価してみましょう。ファインチューニング済みモデルの続きとして、新しい検証データセットを使い、モデルの性能を確認します。

いくつかのやり取りとそれに対応するラベルは、validate_textvalidate_labels として読み込まれています。modeltokenizer も用意されています。

この演習はコースの一部です

Pythonで学ぶ LLM 入門

コースを見る

演習の手順

  • outputs にあるモデルの logits から予測ラベルを抽出します。
  • 実際のラベル(validate_labels)と予測ラベルを比較して、読み込まれている4つの評価指標を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
コードを編集して実行