Začněte nyníZačněte zdarma

Normalizace recenzí

Je čas extrahovat důležitá slova z datasetu filmových recenzí. Nejprve je potřeba normalizovat a pak spočítat jejich četnost. Součástí normalizace je převedení všech slov na malá písmena, odstranění speciálních znaků a extrakce kořene slova – díky tomu se různé tvary téhož slova počítají jako jedno.

Představ si třeba tyto recenze: The movie surprises me very much a Marvel movies always surprise their audience. Při počítání četnosti by se surprises počítalo jednou a surprise také jednou. Přitom sloveso surprise se vyskytuje v obou větách a jeho skutečná četnost by měla být dvě.

Text filmové recenze pro jeden příklad je už uložen v proměnné movie. Obsah proměnné si můžeš zobrazit pomocí print(movie) v IPython Shellu.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Convert to lowercase and print the result
movie_lower = ____
print(____)
Upravit a spustit kód