Kom igångKom igång gratis

Använda evaluate-mått

Nu är det dags att utvärdera din LLM som klassificerar kundtjänstinteraktioner. Du fortsätter där du slutade med din finjusterade modell och använder nu ett nytt valideringsdataset för att bedöma modellens prestanda.

Ett antal interaktioner och deras motsvarande etiketter har laddats in åt dig som validate_text och validate_labels. model och tokenizer är också inlästa.

Den här övningen är en del av kursen

Introduktion till LLM:er i Python

Visa kurs

Övningsinstruktioner

  • Extrahera de förutsagda etiketterna från modellens logits i outputs.
  • Beräkna de fyra inlästa måtten genom att jämföra de verkliga etiketterna (validate_labels) med de förutsagda.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
Redigera och kör kod