Segmentarea propozițiilor cu spaCy
În acest exercițiu vei exersa segmentarea propozițiilor. În NLP, împărțirea unui document în propoziții este o operație de bază foarte utilă. Este unul dintre primii pași în multe sarcini NLP mai complexe, cum ar fi recunoașterea entităților denumite. În plus, numărul de propoziții poate oferi o idee despre cantitatea de informații din text.
Poți accesa zece recenzii culinare în lista numită texts.
Modelul en_core_web_sm a fost deja încărcat pentru tine ca nlp și .
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Rulează modelul
spaCype fiecare element din listatextspentru a compiladocuments, o listă cu toate containereleDoc. - Extrage propozițiile fiecărui container
dociterând prin listadocumentsși adaugă-le într-o listă numităsentences. - Numără propozițiile din fiecare container
docfolosind listasentences.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])