Začněte nyníZačněte zdarma

Odstraňování stopwords

V následujících cvičeních budeš čistit e-maily z Enronu, aby bylo možné data použít v tématieckém modelu. Čištění textu může být náročné, takže se naučíš několik kroků, jak to zvládnout správně. K dispozici máš datový rámec s e-maily df. V prvním kroku je potřeba definovat seznam stopwords a interpunkčních znamének, která budou v dalším cvičení odstraněna z textových dat. Pojďme to vyzkoušet.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj stopwords z ntlk.
  • Definuj anglická slova (english) pro použití jako stopwords a ulož je do proměnné stop.
  • Získej sadu interpunkčních znamének z balíčku string a přiřaď ji do proměnné exclude.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Upravit a spustit kód