Segmentace vět pomocí spaCy
V tomto cvičení si procvičíš segmentaci vět. V NLP je rozdělení dokumentu na jednotlivé věty užitečná základní operace – a také jeden z prvních kroků v náročnějších úlohách, jako je třeba rozpoznávání pojmenovaných entit. Navíc počet vět může leccos prozradit o množství informací, které text obsahuje.
V seznamu texts najdeš deset recenzí jídla.
Model en_core_web_sm je už načtený jako nlp a .
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Spusť model
spaCyna každou položku v seznamutextsa vytvoř takdocuments– seznam všech kontejnerůDoc. - Iteruj přes seznam
documents, extrahuj věty z každého kontejnerudoca přidávej je do seznamusentences. - Pomocí seznamu
sentencesspočítej počet vět v každém kontejnerudoc.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])