Začněte nyníZačněte zdarma

Vyhodnocení generovaného textu pomocí ROUGE

Máš k dispozici 10 vzorků z datasetu pro odpovídání na otázky (Softage-AI/sft-conversational_dataset).

Model TinyLlama-1.1B jsi použil/a k vygenerování odpovědí na tyto vzorky a tvým úkolem je vyhodnotit kvalitu generovaných výsledků vůči správným odpovědím.

Odpovědi vygenerované tímto modelem jsou uloženy v test_answers, správné odpovědi pak v reference_answers. Kvalitu generování modelu vyhodnoť pomocí evaluačních metrik ROUGE.

Toto cvičení je součástí kurzu

Fine-Tuning s Llama 3

Zobrazit kurz

Pokyny k cvičení

  • Importuj evaluační třídu a metriku (metrika ROUGE).
  • Vytvoř instanci evaluační třídy a načti metriku ROUGE.
  • Spusť evaluační instanci s danými reference_answers a test_answers a vypočítej skóre ROUGE.
  • Do proměnné final_score ulož skóre z výsledků, které měří překryv dvojic slov mezi referenčními a vygenerovanými odpověďmi.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Upravit a spustit kód