Odstraňování stopwords
V následujících cvičeních budeš čistit e-maily z Enronu, aby bylo možné data použít v tématieckém modelu. Čištění textu může být náročné, takže se naučíš několik kroků, jak to zvládnout správně. K dispozici máš datový rámec s e-maily df. V prvním kroku je potřeba definovat seznam stopwords a interpunkčních znamének, která budou v dalším cvičení odstraněna z textových dat. Pojďme to vyzkoušet.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Importuj stopwords z
ntlk. - Definuj anglická slova (
english) pro použití jako stopwords a ulož je do proměnnéstop. - Získej sadu interpunkčních znamének z balíčku
stringa přiřaď ji do proměnnéexclude.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)