or
本练习是课程的一部分
音频文件与大多数其他类型的数据不同。在开始处理之前,通常需要预处理。本章将带您完成处理语音文件的第一步:把两种不同的音频文件转换为声波,并对它们进行可视化比较。
当前练习
语音识别尚不完美,但 SpeechRecognition 库提供了与多种语音转文本 API 交互的简便方式。在本章中,您将学习如何使用 SpeechRecognition 库,轻松将音频文件中的口语转换为文本。
并非所有音频文件都具有相同的结构、大小或格式。幸运的是,James Robert 开发的 PyDub 库提供了工具,您可以通过编程方式更改音频文件的各种属性,例如帧率、声道数、文件格式等。在本章中,您将学习如何使用这个实用的库,确保所有音频文件都具备适合转写的正确形态。
本章中,您将把所学内容整合起来,为一家科技公司 Acme Studios 构建一个语音处理概念验证项目。您将先把客户支持电话的音频片段转写为文本,然后基于转写结果使用 NLTK 进行情感分析、使用 spaCy 进行命名实体识别,并使用 scikit-learn 进行文本分类。