or
이 연습은 강의의 일부입니다
오디오 파일은 대부분의 다른 데이터와는 성격이 다릅니다. 작업을 시작하기 전에 전처리가 필요해요. 이 장에서는 두 가지 서로 다른 오디오 파일을 사운드파로 변환하고, 이를 시각적으로 비교하면서 음성 파일을 다루기 위한 첫걸음을 배웁니다.
현재 연습
음성 인식은 아직 완벽과는 거리가 있습니다. 하지만 SpeechRecognition 라이브러리는 다양한 음성-텍스트 API와 쉽게 상호작용할 수 있는 방법을 제공합니다. 이 섹션에서는 SpeechRecognition 라이브러리를 사용해 오디오 파일의 음성을 손쉽게 텍스트로 변환하는 방법을 배웁니다.
모든 오디오 파일이 같은 모양, 크기, 형식을 갖추지는 않습니다. 다행히 James Robert가 만든 PyDub 라이브러리는 프레임 레이트, 채널 수, 파일 형식 등 다양한 오디오 속성을 코드로 손쉽게 변경할 수 있는 도구를 제공합니다. 이 장에서는 전사에 알맞은 형태로 모든 오디오 파일을 정돈하기 위해 이 유용한 라이브러리를 활용하는 방법을 배웁니다.
이 장에서는 지금까지 배운 내용을 종합해 기술 회사 Acme Studios를 위한 음성 처리 개념 증명 프로젝트를 만들어 봅니다. 고객 지원 전화 통화 오디오 조각을 텍스트로 전사하는 것부터 시작해, 전사된 텍스트에 NLTK로 감성 분석을 수행하고, spaCy로 개체명 인식을 적용하며, scikit-learn으로 텍스트 분류를 진행합니다.