Удаление стоп-слов
В следующих упражнениях вы будете очищать электронные письма из набора данных Enron, чтобы подготовить их для тематического моделирования. Очистка текста — непростая задача, поэтому вы изучите несколько шагов, которые помогут сделать это качественно. Датафрейм с письмами df уже доступен. На первом шаге необходимо определить список стоп-слов и знаков препинания, которые будут удалены из текстовых данных в следующем упражнении. Попробуйте!
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Импортируйте стоп-слова из
ntlk. - Определите слова для языка
english, которые будут использоваться в качестве стоп-слов, и сохраните их в переменнуюstop. - Получите набор знаков препинания из пакета
stringи присвойте его переменнойexclude.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)