Lemmatisation avec spaCy
Dans cet exercice, vous allez vous exercer à la lemmatisation. La lemmatisation permet d'obtenir la forme de base des mots dérivés. Ainsi, pour une phrase donnée, on s'attend à ce que le nombre de lemmes soit inférieur ou égal au nombre de jetons.
La première évaluation de produit alimentaire sur Amazon vous est fournie dans une chaîne appelée text. en_core_web_sm est chargé dans nlp et a été exécuté sur text pour créer document, un conteneur Doc pour cette chaîne de texte.
tokens, une liste contenant les jetons de text, est aussi déjà chargé et prêt à être utilisé.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Instructions de l’exercice
- Ajouter le lemme pour tous les jetons dans
document, puis afficher la listelemmas. - Afficher la liste
tokenset observer les différences entretokensetlemmas.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)