Nettoyer un billet de blogue
Dans cet exercice, on vous fournit un extrait d'un billet de blogue. Votre tâche consiste à nettoyer ce texte pour qu'il soit plus facile à traiter par machine. Cela implique de convertir en minuscules, de faire la lemmatisation et de retirer les mots vides, la ponctuation et les caractères non alphabétiques.
L'extrait est disponible sous forme de chaîne blog et a été affiché dans la console. La liste des mots vides est disponible dans stopwords.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- À l'aide d'une compréhension de liste, parcourez
docpour extraire lelemma_de chaque jeton. - Retirez les mots vides et les jetons non alphabétiques en utilisant
stopwordsetisalpha().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))