1. Learn
  2. /
  3. Courses
  4. /
  5. Обробка усного мовлення в Python

Connected

Exercise

Визначення іменованих сутностей у spaCy

Іменовані сутності — це об'єкти реального світу з назвами, наприклад міста, люди, дати чи час. Ми можемо використати spaCy, щоб знаходити іменовані сутності в нашому транскрибованому тексті.

У цій вправі ви транскрибуєте call_4_channel_2.wav (файл) за допомогою transcribe_audio(), а потім використаєте мовну модель spaCy, en_core_web_sm, щоб перетворити транскрибований текст на документ spaCy.

Перетворення тексту на документ spaCy дає змогу використати вбудовані можливості spaCy для аналізу тексту: .text для токенів (окремих слів), .sents для речень і .ents для іменованих сутностей.

Instructions 1/4

undefined XP
  • 1
    • Створіть doc spaCy, передавши транскрибований текст call 4 channel 2 у nlp(), а потім перевірте його тип.
  • 2
    • Створіть doc spaCy з call_4_channel_2_text, потім виведіть увесь текст токенів у ньому за допомогою атрибута .text.
  • 3
    • Завантажте мовну модель "en_core_web_sm", а потім виведіть речення в doc за допомогою атрибута .sents.
  • 4
    • Зверніться до сутностей у документі за допомогою .ents, а потім виведіть текст кожної.