CommencezCommencez gratuitement

Nettoyer des données textuelles

Maintenant que vous avez défini les mots vides et ponctuations, utilisons-les pour nettoyer davantage nos courriels Enron dans le dataframe df. Les listes contenant les mots vides et la ponctuation sont accessibles via stop et exclude. Il reste quelques étapes avant d'obtenir des données vraiment propres, comme la « lemmatisation » des mots et la racination des verbes. Les verbes dans les données de courriels sont déjà racinés, et la lemmatisation est déjà faite pour vous dans cet exercice.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Modifier et exécuter le code