Normalizace recenzí
Je čas extrahovat důležitá slova z datasetu filmových recenzí. Nejprve je potřeba normalizovat a pak spočítat jejich četnost. Součástí normalizace je převedení všech slov na malá písmena, odstranění speciálních znaků a extrakce kořene slova – díky tomu se různé tvary téhož slova počítají jako jedno.
Představ si třeba tyto recenze: The movie surprises me very much a Marvel movies always surprise their audience. Při počítání četnosti by se surprises počítalo jednou a surprise také jednou. Přitom sloveso surprise se vyskytuje v obou větách a jeho skutečná četnost by měla být dvě.
Text filmové recenze pro jeden příklad je už uložen v proměnné movie. Obsah proměnné si můžeš zobrazit pomocí print(movie) v IPython Shellu.
Toto cvičení je součástí kurzu
Regular Expressions in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Convert to lowercase and print the result
movie_lower = ____
print(____)