开始使用免费开始使用

使用 PyDub 归一化音频文件

有时音频文件中,讲话的某些片段很响,而另一些片段又很轻。这样的音量差异会影响转录效果。

幸运的是,PyDub 的 effects 模块提供了 normalize() 函数。它会先找到一个 AudioSegment 的最大音量,然后按比例调整其余部分。也就是说,较安静的部分会被适当放大。

您可以在此处收听一个先响后轻的示例音频文件 loud_then_quiet.wavhere

在本练习中,您将使用 normalize() 来归一化该文件的音量,使其听起来更接近这个效果

本练习是课程的一部分

Python 语音语言处理

查看课程

练习说明

  • PyDub 导入 AudioSegment,并从其 effects 模块导入 normalize
  • 导入目标音频文件 loud_then_quiet.wav,并保存为 loud_then_quiet
  • 使用 normalize() 函数对导入的音频进行归一化,并保存为 normalized_loud_then_quiet

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____

# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)

# Normalize target audio file
normalized_loud_then_quiet = ____(____)
编辑并运行代码