CommencezCommencez gratuitement

Lemmatisation avec spaCy

Dans cet exercice, vous allez vous exercer à la lemmatisation. La lemmatisation permet d'obtenir la forme de base des mots dérivés. Ainsi, pour une phrase donnée, on s'attend à ce que le nombre de lemmes soit inférieur ou égal au nombre de jetons.

La première évaluation de produit alimentaire sur Amazon vous est fournie dans une chaîne appelée text. en_core_web_sm est chargé dans nlp et a été exécuté sur text pour créer document, un conteneur Doc pour cette chaîne de texte.

tokens, une liste contenant les jetons de text, est aussi déjà chargé et prêt à être utilisé.

Cette activité fait partie du cours

Traitement du langage naturel avec spaCy

Voir le cours

Instructions de l’exercice

  • Ajouter le lemme pour tous les jetons dans document, puis afficher la liste lemmas.
  • Afficher la liste tokens et observer les différences entre tokens et lemmas.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Modifier et exécuter le code