Normalisera recensioner
Nu är det dags att extrahera viktiga ord från din filmrecensiondatamängd. Först behöver du normalisera dem och sedan räkna deras frekvens. En del av normaliseringen innebär att konvertera alla ord till gemener, ta bort specialtecken och extrahera roten av ett ord så att varianter räknas som ett och samma ord.
Föreställ dig att du har följande recensioner: The movie surprises me very much och Marvel movies always surprise their audience. Om du räknar ordfrekvensen får du surprises en gång och surprise en gång. Men verbet surprise förekommer i båda och dess frekvens borde vara två.
Texten från en filmrecension för ett enskilt exempel har redan sparats i variabeln movie. Du kan använda print(movie) för att visa variabeln i IPython Shell.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Convert to lowercase and print the result
movie_lower = ____
print(____)