CommencezCommencez gratuitement

Ajouter des composants (pipes) dans spaCy

Vous utilisez souvent un modèle spaCy existant pour différentes tâches de NLP. Cependant, dans certains cas, un composant prêt à l'emploi, comme la segmentation en phrases, peut prendre beaucoup de temps avant de donner les résultats attendus. Dans cet exercice, vous allez vous exercer à ajouter un composant de chaîne de traitement à un modèle spaCy (chaîne de traitement du texte).

Vous utiliserez les cinq premiers avis du jeu de données Amazon Fine Food Reviews pour cet exercice. Vous pouvez accéder à ces avis à l'aide de la chaîne de caractères texts.

Le module spaCy est déjà importé et prêt à l'emploi.

Cette activité fait partie du cours

Traitement du langage naturel avec spaCy

Voir le cours

Instructions de l’exercice

  • Chargez un modèle anglais spaCy vierge et ajoutez-y le composant sentencizer.
  • Créez un conteneur Doc pour texts, créez une liste pour stocker les sentences du document donné et affichez le nombre de phrases.
  • Affichez la liste des jetons de la deuxième phrase à partir de la liste sentences.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Modifier et exécuter le code