Rozpoznávání pojmenovaných entit v spaCy
Pojmenované entity jsou objekty reálného světa, které mají název – například města, osoby, data nebo časy. Ke hledání pojmenovaných entit v přepisech textu můžeme využít spaCy.
V tomto cvičení přepíšeš call_4_channel_2.wav (soubor) pomocí transcribe_audio() a pak použiješ jazykový model spaCy – en_core_web_sm – k převodu přepsaného textu na spaCy doc.
Převedení textu na spaCy doc ti umožní využít vestavěné funkce spaCy pro analýzu textu: .text pro tokeny (jednotlivá slova), .sents pro věty a .ents pro pojmenované entity.
Toto cvičení je součástí kurzu
Zpracování mluveného jazyka v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
import spacy
# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")
# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")
# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)
# Check the type of doc
print(type(___))