spaCy에서 개체명 인식
개체명(named entities)은 도시, 사람, 날짜, 시간처럼 실제 세계의 이름을 가진 객체를 말해요. 전사된 텍스트에서 개체명을 찾기 위해 spaCy를 사용할 수 있어요.
이번 연습에서는 transcribe_audio()로 call_4_channel_2.wav(file)를 텍스트로 전사한 다음, spaCy의 언어 모델 en_core_web_sm을 사용해 전사된 텍스트를 spaCy doc으로 변환해 볼 거예요.
텍스트를 spaCy doc으로 변환하면, 토큰(단어)에는 .text, 문장에는 .sents, 개체명에는 .ents처럼 텍스트 분석을 위한 spaCy의 내장 기능을 활용할 수 있어요.
이 연습은 강의의 일부입니다
Python으로 배우는 음성 언어 처리
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
import spacy
# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")
# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")
# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)
# Check the type of doc
print(type(___))