Začněte nyníZačněte zdarma

Segmentace vět pomocí spaCy

V tomto cvičení si procvičíš segmentaci vět. V NLP je rozdělení dokumentu na jednotlivé věty užitečná základní operace – a také jeden z prvních kroků v náročnějších úlohách, jako je třeba rozpoznávání pojmenovaných entit. Navíc počet vět může leccos prozradit o množství informací, které text obsahuje.

V seznamu texts najdeš deset recenzí jídla.

Model en_core_web_sm je už načtený jako nlp a .

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Spusť model spaCy na každou položku v seznamu texts a vytvoř tak documents – seznam všech kontejnerů Doc.
  • Iteruj přes seznam documents, extrahuj věty z každého kontejneru doc a přidávej je do seznamu sentences.
  • Pomocí seznamu sentences spočítej počet vět v každém kontejneru doc.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
Upravit a spustit kód