Zpracování textu pomocí spaCy
Každá NLP aplikace se skládá z několika kroků zpracování textu. Některé z nich už znáš – například tokenizaci, lemmatizaci, segmentaci vět a rozpoznávání pojmenovaných entit.
V tomto cvičení si dál procvičíš kroky zpracování textu v spaCy – konkrétně rozdělení textu na věty a extrakci pojmenovaných entit. Budeme pracovat s prvními pěti recenzemi z datové sady Amazon Fine Food Reviews, ke kterým máš přístup přes objekt texts.
Model en_core_web_sm je už načtený a dostupný přes proměnnou nlp. Seznam kontejnerů Doc pro každou položku v texts je také předpřipravený a přístupný přes proměnnou documents.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)