Förstå utvärderingsmått för textgenerering
På PyBooks utvärderade teamet nyligen en förtränad modells prestanda med hjälp av BLEU-poäng och fick ett resultat på ungefär 0,082 samt ett rouge1_fmeasure-värde på cirka 0,2692. Det här måttet är ett uttryck för precision (hur stor andel av de valda elementen som är relevanta) och återkallelse (hur stor andel av de relevanta elementen som valts ut). Hur tolkar du det här resultatet i termer av modellens prestanda?
Den här övningen är en del av kursen
Djupinlärning för text med PyTorch
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen