НачатьНачать бесплатно

Нормализация аудиофайла с помощью PyDub

Иногда в аудиофайлах речь звучит то громко, то тихо. Такие перепады громкости могут мешать транскрибированию.

К счастью, модуль effects библиотеки PyDub содержит функцию normalize(), которая находит максимальную громкость в AudioSegment и подстраивает под неё остальные участки. Благодаря этому тихие фрагменты становятся громче.

Послушать пример аудиофайла, в котором звук сначала громкий, а затем затихает, loud_then_quiet.wav, можно здесь.

В этом упражнении вы воспользуетесь функцией normalize(), чтобы выровнять громкость файла — результат будет звучать примерно вот так.

Это упражнение является частью курса

Обработка устной речи на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте AudioSegment из PyDub и normalize из модуля effects библиотеки PyDub.
  • Загрузите целевой аудиофайл loud_then_quiet.wav и сохраните его в переменную loud_then_quiet.
  • Нормализуйте загруженный аудиофайл с помощью функции normalize() и сохраните результат в переменную normalized_loud_then_quiet.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____

# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)

# Normalize target audio file
normalized_loud_then_quiet = ____(____)
Редактировать и запускать код