ÎncepețiÎncepe gratuit

Curățarea unei postări de blog

În acest exercițiu, ai la dispoziție un fragment dintr-o postare de blog. Sarcina ta este să cureți acest text și să-l transformi într-un format mai potrivit pentru prelucrare automată. Acest lucru presupune conversia la litere mici, lematizare și eliminarea cuvintelor de oprire, a punctuației și a caracterelor non-alfabetice.

Fragmentul este disponibil ca șir de caractere blog și a fost afișat în consolă. Lista cuvintelor de oprire este disponibilă ca stopwords.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosind o listă comprehensivă, parcurge doc pentru a extrage lemma_ din fiecare token.
  • Elimină cuvintele de oprire și tokenii non-alfabetici folosind stopwords și isalpha().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Editează și rulează codul