Usuwanie stopwords
W kolejnych ćwiczeniach będziesz czyścić e-maile z korpusu Enron, aby przygotować dane do modelu tematycznego. Czyszczenie tekstu bywa wymagające, dlatego poznasz kilka kroków, które pomogą zrobić to dobrze. Dostępna jest ramka danych z e-mailami df. W pierwszym kroku zdefiniuj listę stopwords i znaków interpunkcyjnych, które zostaną usunięte z danych tekstowych w kolejnym ćwiczeniu. Wypróbuj!
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj stopwords z pakietu
ntlk. - Zdefiniuj angielskie słowa do użycia jako stopwords i przypisz je do zmiennej
stop. - Pobierz zbiór znaków interpunkcyjnych z pakietu
stringi przypisz go do zmiennejexclude.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)