시작하기무료로 시작하기

spaCy에서 개체명 인식

개체명(named entities)은 도시, 사람, 날짜, 시간처럼 실제 세계의 이름을 가진 객체를 말해요. 전사된 텍스트에서 개체명을 찾기 위해 spaCy를 사용할 수 있어요.

이번 연습에서는 transcribe_audio()call_4_channel_2.wav(file)를 텍스트로 전사한 다음, spaCy의 언어 모델 en_core_web_sm을 사용해 전사된 텍스트를 spaCy doc으로 변환해 볼 거예요.

텍스트를 spaCy doc으로 변환하면, 토큰(단어)에는 .text, 문장에는 .sents, 개체명에는 .ents처럼 텍스트 분석을 위한 spaCy의 내장 기능을 활용할 수 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 음성 언어 처리

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

import spacy

# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")

# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")

# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)

# Check the type of doc
print(type(___))
코드 편집 및 실행