ПочатиПочніть безкоштовно

Вилучення стоп-слів

У наступних вправах ви будете очищати електронні листи Enron, щоб підготувати дані для тематичного моделювання. Очищення тексту може бути складним, тож ви навчитеся крокам, які допоможуть зробити це якісно. Датафрейм із листами df доступний. На першому кроці потрібно визначити список стоп-слів і пунктуаційних знаків, які слід вилучити з текстових даних у наступній вправі. Спробуймо.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте стоп-слова з ntlk.
  • Визначте слова 'english' як стоп-слова у змінній stop.
  • Отримайте набір пунктуаційних знаків із пакета string і присвоїть його змінній exclude.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Редагувати та запускати код