spaCy での固有表現認識
固有表現は、都市、人名、日付や時刻など、現実世界に存在する名前付きの対象を指します。転写したテキストから固有表現を見つけるには spaCy を使えます。
この演習では、transcribe_audio() を使って call_4_channel_2.wav(file)を文字起こしし、その後 spaCy の言語モデル en_core_web_sm を用いて、転写テキストを spaCy の doc に変換します。
テキストを spaCy の doc に変換すると、トークン(単語)に対する .text、文に対する .sents、固有表現に対する .ents など、spaCy が備えるテキスト解析機能を活用できます。
この演習はコースの一部です
Pythonで学ぶ音声言語処理
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
import spacy
# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")
# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")
# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)
# Check the type of doc
print(type(___))