Zacznij terazZacznij za darmo

Ocena wygenerowanego tekstu przy użyciu ROUGE

Dysponujesz 10 próbkami z zestawu danych do odpowiadania na pytania (Softage-AI/sft-conversational_dataset).

Do wygenerowania odpowiedzi na te próbki użyto modelu TinyLlama-1.1B. Twoim zadaniem jest ocena jakości wygenerowanych odpowiedzi w porównaniu z odpowiedziami wzorcowymi.

Odpowiedzi wygenerowane przez model są dostępne w zmiennej test_answers, a odpowiedzi wzorcowe w zmiennej reference_answers. Użyj metryk ewaluacyjnych ROUGE, aby ocenić jakość generowania modelu.

To ćwiczenie jest częścią kursu

Fine-Tuning z Llama 3

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę ewaluacyjną i metrykę (metryka ROUGE).
  • Utwórz instancję klasy ewaluacyjnej i załaduj metrykę ROUGE.
  • Uruchom instancję ewaluatora z podanymi zmiennymi reference_answers i test_answers, aby obliczyć wyniki ROUGE.
  • Zapisz w zmiennej final_score wynik z rezultatów, który sprawdza pokrycie par słów między odpowiedziami wzorcowymi a wygenerowanymi.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Edytuj i uruchom kod