CommencezCommencez gratuitement

Tokenisation avec spaCy

Dans cet exercice, vous allez vous exercer à tokeniser du texte. Vous utiliserez la première évaluation du jeu de données Amazon Fine Food Reviews pour cet exercice. Vous pouvez y accéder au moyen de l'objet text fourni.

Le modèle en_core_web_sm est déjà chargé pour vous. Vous pouvez y accéder en appelant nlp(). Vous pouvez utiliser une compréhension de liste pour constituer des listes de sortie.

Cette activité fait partie du cours

Traitement du langage naturel avec spaCy

Voir le cours

Instructions de l’exercice

  • Stockez le conteneur Doc de l'évaluation préchargée dans un objet document.
  • Stockez et examinez les textes de tous les jetons du document dans la variable first_text_tokens.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Modifier et exécuter le code