Procesarea textului cu spaCy
Orice aplicație NLP presupune mai mulți pași de procesare a textului. Ai învățat deja câțiva dintre aceștia: tokenizarea, lematizarea, segmentarea în propoziții și recunoașterea entităților denumite.
În acest exercițiu, vei exersa în continuare pașii de procesare a textului în spaCy – cum ar fi împărțirea textului în propoziții și extragerea entităților denumite. Vei folosi primele cinci recenzii din setul de date Amazon Fine Food Reviews. Le poți accesa prin obiectul texts.
Modelul en_core_web_sm a fost deja încărcat și îl poți folosi prin variabila nlp. Lista containerelor Doc pentru fiecare element din texts este și ea pre-încărcată și accesibilă prin documents.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)