ПочатиПочніть безкоштовно

Очищення текстових даних

Тепер, коли ви визначили стоп-слова та розділові знаки, скористаймося ними, щоб додатково очистити листи enron у датафреймі df. Списки зі стоп-словами та пунктуацією доступні в змінних stop і exclude. Перш ніж дані будуть повністю очищені, лишилося ще кілька кроків, зокрема лематизація слів і стемінг дієслів. Дієслова в цих листах уже простемлено, а лематизацію в цій вправі також виконано за вас.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Редагувати та запускати код