CommencezCommencez gratuitement

Nettoyer un billet de blogue

Dans cet exercice, on vous fournit un extrait d'un billet de blogue. Votre tâche consiste à nettoyer ce texte pour qu'il soit plus facile à traiter par machine. Cela implique de convertir en minuscules, de faire la lemmatisation et de retirer les mots vides, la ponctuation et les caractères non alphabétiques.

L'extrait est disponible sous forme de chaîne blog et a été affiché dans la console. La liste des mots vides est disponible dans stopwords.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • À l'aide d'une compréhension de liste, parcourez doc pour extraire le lemma_ de chaque jeton.
  • Retirez les mots vides et les jetons non alphabétiques en utilisant stopwords et isalpha().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Modifier et exécuter le code