CommencezCommencez gratuitement

Retirer les mots vides

Dans les exercices suivants, vous allez nettoyer les courriels d'Enron afin de pouvoir utiliser les données dans un modèle thématique. Le nettoyage de texte peut être ardu ; vous verrez donc quelques étapes pour bien le faire. Le dataframe qui contient les courriels, df, est disponible. Dans un premier temps, vous devez définir la liste des mots vides et des signes de ponctuation à retirer du texte dans l'exercice suivant. À vous de jouer !

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Importez les stopwords depuis ntlk.
  • Définissez les mots 'english' à utiliser comme stopwords dans la variable stop.
  • Récupérez l'ensemble de la ponctuation à partir du module string et assignez-le à exclude.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Modifier et exécuter le code