Ajouter des composants (pipes) dans spaCy
Vous utilisez souvent un modèle spaCy existant pour différentes tâches de NLP. Cependant, dans certains cas, un composant prêt à l'emploi, comme la segmentation en phrases, peut prendre beaucoup de temps avant de donner les résultats attendus. Dans cet exercice, vous allez vous exercer à ajouter un composant de chaîne de traitement à un modèle spaCy (chaîne de traitement du texte).
Vous utiliserez les cinq premiers avis du jeu de données Amazon Fine Food Reviews pour cet exercice. Vous pouvez accéder à ces avis à l'aide de la chaîne de caractères texts.
Le module spaCy est déjà importé et prêt à l'emploi.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Instructions de l’exercice
- Chargez un modèle anglais
spaCyvierge et ajoutez-y le composantsentencizer. - Créez un conteneur
Docpourtexts, créez une liste pour stocker lessentencesdu document donné et affichez le nombre de phrases. - Affichez la liste des jetons de la deuxième phrase à partir de la liste
sentences.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])