使用 evaluate 指標
現在該評估你用來分類客服互動內容的 LLM 了。延續你先前微調完成的模型,你將使用新的驗證資料集來檢視模型的效能。
部分互動內容及其對應標籤已替你載入為 validate_text 和 validate_labels。model 與 tokenizer 也已載入。
本練習屬於課程
Python 的 LLM 入門
練習說明
- 從
outputs中的 model logits 萃取預測標籤。 - 透過比較真實標籤(
validate_labels)與預測標籤,計算已載入的 4 個指標。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))