Визначення іменованих сутностей у spaCy
Іменовані сутності — це об'єкти реального світу з назвами, наприклад міста, люди, дати чи час. Ми можемо використати spaCy, щоб знаходити іменовані сутності в нашому транскрибованому тексті.
У цій вправі ви транскрибуєте call_4_channel_2.wav (файл) за допомогою transcribe_audio(), а потім використаєте мовну модель spaCy, en_core_web_sm, щоб перетворити транскрибований текст на документ spaCy.
Перетворення тексту на документ spaCy дає змогу використати вбудовані можливості spaCy для аналізу тексту: .text для токенів (окремих слів), .sents для речень і .ents для іменованих сутностей.
Ця вправа є частиною курсу
Обробка усного мовлення в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import spacy
# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")
# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")
# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)
# Check the type of doc
print(type(___))