Normaliser les critiques
Il est temps d’extraire des mots importants présents dans votre jeu de données de critiques de films. Vous devez d’abord les normaliser, puis compter leur fréquence. La normalisation consiste notamment à convertir tous les mots en minuscules, à supprimer les caractères spéciaux et à extraire la racine d’un mot afin de compter ses variantes comme une seule occurrence.
Imaginons les critiques suivantes : The movie surprises me very much et Marvel movies always surprise their audience. Si vous comptez la fréquence des mots, vous obtiendrez surprises une fois et surprise une fois. Pourtant, le verbe surprise est présent dans les deux phrases ; sa fréquence devrait donc être de deux.
Le texte d’une critique de film pour un seul exemple a déjà été enregistré dans la variable movie. Vous pouvez utiliser print(movie) pour afficher la variable dans l’IPython Shell.
Cet exercice fait partie du cours
<cours>Expressions rationnelles en Python</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Convert to lowercase and print the result
movie_lower = ____
print(____)