Vyhodnocení generovaného textu pomocí ROUGE
Máš k dispozici 10 vzorků z datasetu pro odpovídání na otázky (Softage-AI/sft-conversational_dataset).
Model TinyLlama-1.1B jsi použil/a k vygenerování odpovědí na tyto vzorky a tvým úkolem je vyhodnotit kvalitu generovaných výsledků vůči správným odpovědím.
Odpovědi vygenerované tímto modelem jsou uloženy v test_answers, správné odpovědi pak v reference_answers. Kvalitu generování modelu vyhodnoť pomocí evaluačních metrik ROUGE.
Toto cvičení je součástí kurzu
Fine-Tuning s Llama 3
Pokyny k cvičení
- Importuj evaluační třídu a metriku (metrika ROUGE).
- Vytvoř instanci evaluační třídy a načti metriku ROUGE.
- Spusť evaluační instanci s danými
reference_answersatest_answersa vypočítej skóre ROUGE. - Do proměnné
final_scoreulož skóre z výsledků, které měří překryv dvojic slov mezi referenčními a vygenerovanými odpověďmi.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)