Zacznij terazZacznij za darmo

Usuwanie stopwords

W kolejnych ćwiczeniach będziesz czyścić e-maile z korpusu Enron, aby przygotować dane do modelu tematycznego. Czyszczenie tekstu bywa wymagające, dlatego poznasz kilka kroków, które pomogą zrobić to dobrze. Dostępna jest ramka danych z e-mailami df. W pierwszym kroku zdefiniuj listę stopwords i znaków interpunkcyjnych, które zostaną usunięte z danych tekstowych w kolejnym ćwiczeniu. Wypróbuj!

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj stopwords z pakietu ntlk.
  • Zdefiniuj angielskie słowa do użycia jako stopwords i przypisz je do zmiennej stop.
  • Pobierz zbiór znaków interpunkcyjnych z pakietu string i przypisz go do zmiennej exclude.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Edytuj i uruchom kod