Začněte nyníZačněte zdarma

Čištění textových dat

Teď, když máš definované stopwords a interpunkci, použijeme je k dalšímu čištění e-mailů z Enronu v dataframu df. Seznamy se stopwords a interpunkcí jsou dostupné pod proměnnými stop a exclude. Než budeš mít data plně vyčištěná, čeká tě ještě několik kroků – například „lemmatizace" slov a stemming sloves. Slovesa v e-mailových datech jsou již stemmována a lemmatizace je v tomto cvičení připravena za tebe.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Upravit a spustit kód