Traitement de texte avec spaCy
Chaque application de NLP comprend plusieurs étapes de traitement de texte. Vous avez déjà vu certaines de ces étapes, notamment la tokenisation, la lemmatisation, la segmentation en phrases et la reconnaissance d'entités nommées.
Dans cet exercice, vous allez continuer à vous exercer aux étapes de traitement de texte dans spaCy, comme découper le texte en phrases et extraire les entités nommées. Vous utiliserez les cinq premières évaluations du jeu de données Amazon Fine Food Reviews. Vous pouvez accéder à ces évaluations au moyen de l'objet texts.
Le modèle en_core_web_sm a déjà été chargé pour vous et est accessible via nlp. La liste des contenants Doc pour chaque élément de texts est aussi préchargée et accessible dans documents.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)