始める無料で始める

spaCy での固有表現認識

固有表現は、都市、人名、日付や時刻など、現実世界に存在する名前付きの対象を指します。転写したテキストから固有表現を見つけるには spaCy を使えます。

この演習では、transcribe_audio() を使って call_4_channel_2.wavfile)を文字起こしし、その後 spaCy の言語モデル en_core_web_sm を用いて、転写テキストを spaCydoc に変換します。

テキストを spaCydoc に変換すると、トークン(単語)に対する .text、文に対する .sents、固有表現に対する .ents など、spaCy が備えるテキスト解析機能を活用できます。

この演習はコースの一部です

Pythonで学ぶ音声言語処理

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

import spacy

# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")

# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")

# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)

# Check the type of doc
print(type(___))
コードを編集して実行