НачатьНачать бесплатно

Удаление стоп-слов

В следующих упражнениях вы будете очищать электронные письма из набора данных Enron, чтобы подготовить их для тематического моделирования. Очистка текста — непростая задача, поэтому вы изучите несколько шагов, которые помогут сделать это качественно. Датафрейм с письмами df уже доступен. На первом шаге необходимо определить список стоп-слов и знаков препинания, которые будут удалены из текстовых данных в следующем упражнении. Попробуйте!

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте стоп-слова из ntlk.
  • Определите слова для языка english, которые будут использоваться в качестве стоп-слов, и сохраните их в переменную stop.
  • Получите набор знаков препинания из пакета string и присвойте его переменной exclude.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Редактировать и запускать код