Čištění příspěvku na blogu
V tomto cvičení máš k dispozici úryvek z příspěvku na blogu. Tvým úkolem je převést tento text do formátu vhodnějšího pro zpracování počítačem. To zahrnuje převod na malá písmena, lemmatizaci a odstranění stopwords, interpunkce a nealfabetických znaků.
Úryvek je dostupný jako řetězec blog a byl vypsán do konzole. Seznam stopwords je dostupný jako stopwords.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Pomocí list comprehension projdi
doca extrahujlemma_každého tokenu. - Odstraň stopwords a nealfabetické tokeny pomocí
stopwordsaisalpha().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))