Ocena wygenerowanego tekstu przy użyciu ROUGE
Dysponujesz 10 próbkami z zestawu danych do odpowiadania na pytania (Softage-AI/sft-conversational_dataset).
Do wygenerowania odpowiedzi na te próbki użyto modelu TinyLlama-1.1B. Twoim zadaniem jest ocena jakości wygenerowanych odpowiedzi w porównaniu z odpowiedziami wzorcowymi.
Odpowiedzi wygenerowane przez model są dostępne w zmiennej test_answers, a odpowiedzi wzorcowe w zmiennej reference_answers. Użyj metryk ewaluacyjnych ROUGE, aby ocenić jakość generowania modelu.
To ćwiczenie jest częścią kursu
Fine-Tuning z Llama 3
Instrukcje do ćwiczenia
- Zaimportuj klasę ewaluacyjną i metrykę (metryka ROUGE).
- Utwórz instancję klasy ewaluacyjnej i załaduj metrykę ROUGE.
- Uruchom instancję ewaluatora z podanymi zmiennymi
reference_answersitest_answers, aby obliczyć wyniki ROUGE. - Zapisz w zmiennej
final_scorewynik z rezultatów, który sprawdza pokrycie par słów między odpowiedziami wzorcowymi a wygenerowanymi.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)