Använda evaluate-mått
Nu är det dags att utvärdera din LLM som klassificerar kundtjänstinteraktioner. Du fortsätter där du slutade med din finjusterade modell och använder nu ett nytt valideringsdataset för att bedöma modellens prestanda.
Ett antal interaktioner och deras motsvarande etiketter har laddats in åt dig som validate_text och validate_labels. model och tokenizer är också inlästa.
Den här övningen är en del av kursen
Introduktion till LLM:er i Python
Övningsinstruktioner
- Extrahera de förutsagda etiketterna från modellens logits i
outputs. - Beräkna de fyra inlästa måtten genom att jämföra de verkliga etiketterna (
validate_labels) med de förutsagda.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))