開始使用免費開始

使用 evaluate 指標

現在該評估你用來分類客服互動內容的 LLM 了。延續你先前微調完成的模型,你將使用新的驗證資料集來檢視模型的效能。

部分互動內容及其對應標籤已替你載入為 validate_textvalidate_labelsmodeltokenizer 也已載入。

本練習屬於課程

Python 的 LLM 入門

檢視課程

練習說明

  • outputs 中的 model logits 萃取預測標籤。
  • 透過比較真實標籤(validate_labels)與預測標籤,計算已載入的 4 個指標。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
編輯並執行程式碼