Curățarea unei postări de blog
În acest exercițiu, ai la dispoziție un fragment dintr-o postare de blog. Sarcina ta este să cureți acest text și să-l transformi într-un format mai potrivit pentru prelucrare automată. Acest lucru presupune conversia la litere mici, lematizare și eliminarea cuvintelor de oprire, a punctuației și a caracterelor non-alfabetice.
Fragmentul este disponibil ca șir de caractere blog și a fost afișat în consolă. Lista cuvintelor de oprire este disponibilă ca stopwords.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Folosind o listă comprehensivă, parcurge
docpentru a extragelemma_din fiecare token. - Elimină cuvintele de oprire și tokenii non-alfabetici folosind
stopwordsșiisalpha().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))