Reviews normalisieren
Es ist Zeit, einige wichtige Wörter aus deinem Datensatz mit Filmrezensionen zu extrahieren. Zuerst musst du sie normalisieren und anschließend ihre Häufigkeit zählen. Zur Normalisierung gehört, alle Wörter in Kleinbuchstaben umzuwandeln, Sonderzeichen zu entfernen und den Wortstamm zu extrahieren, sodass du Varianten als ein Wort zählst.
Stell dir vor, du hast folgende Reviews: The movie surprises me very much und Marvel movies always surprise their audience. Wenn du die Worthäufigkeit zählst, würdest du surprises einmal und surprise einmal zählen. Das Verb surprise kommt jedoch in beiden Sätzen vor, seine Häufigkeit sollte also zwei sein.
Der Text einer einzelnen Filmrezension wurde bereits in der Variable movie gespeichert. Mit print(movie) kannst du dir den Inhalt in der IPython Shell ansehen.
Diese Übung ist Teil des Kurses
<Kurs>Reguläre Ausdrücke in Python</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Convert to lowercase and print the result
movie_lower = ____
print(____)