Kom igångKom igång gratis

Rensa textdata

Nu när du har definierat stoppord och skiljetecken, använder vi dessa för att rensa Enron-e-postmeddelandena i dataframe:n df ytterligare. Listorna med stoppord och skiljetecken finns tillgängliga som stop och exclude. Det finns ytterligare några steg kvar innan du har rengjord data, till exempel "lemmatisering" av ord och stamsökning av verb. Verben i e-postdata är redan stamade, och lemmatiseringen är redan gjord åt dig i den här övningen.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Redigera och kör kod