Začněte nyníZačněte zdarma

Zpracování textu pomocí spaCy

Každá NLP aplikace se skládá z několika kroků zpracování textu. Některé z nich už znáš – například tokenizaci, lemmatizaci, segmentaci vět a rozpoznávání pojmenovaných entit.

spaCy NLP Pipeline

V tomto cvičení si dál procvičíš kroky zpracování textu v spaCy – konkrétně rozdělení textu na věty a extrakci pojmenovaných entit. Budeme pracovat s prvními pěti recenzemi z datové sady Amazon Fine Food Reviews, ke kterým máš přístup přes objekt texts.

Model en_core_web_sm je už načtený a dostupný přes proměnnou nlp. Seznam kontejnerů Doc pro každou položku v texts je také předpřipravený a přístupný přes proměnnou documents.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
Upravit a spustit kód