НачатьНачать бесплатно

Очистка текстовых данных

Теперь, когда вы определили стоп-слова и знаки пунктуации, используйте их для дополнительной очистки писем Enron в датафрейме df. Списки стоп-слов и знаков пунктуации доступны в переменных stop и exclude. Прежде чем данные будут полностью очищены, необходимо выполнить ещё несколько шагов: «лемматизацию» слов и стемминг глаголов. Глаголы в данных писем уже прошли стемминг, а лемматизация в этом упражнении выполнена за вас.

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Редактировать и запускать код