Začněte nyníZačněte zdarma

Čištění příspěvku na blogu

V tomto cvičení máš k dispozici úryvek z příspěvku na blogu. Tvým úkolem je převést tento text do formátu vhodnějšího pro zpracování počítačem. To zahrnuje převod na malá písmena, lemmatizaci a odstranění stopwords, interpunkce a nealfabetických znaků.

Úryvek je dostupný jako řetězec blog a byl vypsán do konzole. Seznam stopwords je dostupný jako stopwords.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí list comprehension projdi doc a extrahuj lemma_ každého tokenu.
  • Odstraň stopwords a nealfabetické tokeny pomocí stopwords a isalpha().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Upravit a spustit kód