Retirer les mots vides
Dans les exercices suivants, vous allez nettoyer les courriels d'Enron afin de pouvoir utiliser les données dans un modèle thématique. Le nettoyage de texte peut être ardu ; vous verrez donc quelques étapes pour bien le faire. Le dataframe qui contient les courriels, df, est disponible. Dans un premier temps, vous devez définir la liste des mots vides et des signes de ponctuation à retirer du texte dans l'exercice suivant. À vous de jouer !
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Importez les stopwords depuis
ntlk. - Définissez les mots 'english' à utiliser comme stopwords dans la variable
stop. - Récupérez l'ensemble de la ponctuation à partir du module
stringet assignez-le àexclude.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)