Нормализация аудиофайла с помощью PyDub
Иногда в аудиофайлах речь звучит то громко, то тихо. Такие перепады громкости могут мешать транскрибированию.
К счастью, модуль effects библиотеки PyDub содержит функцию normalize(), которая находит максимальную громкость в AudioSegment и подстраивает под неё остальные участки. Благодаря этому тихие фрагменты становятся громче.
Послушать пример аудиофайла, в котором звук сначала громкий, а затем затихает, loud_then_quiet.wav, можно здесь.
В этом упражнении вы воспользуетесь функцией normalize(), чтобы выровнять громкость файла — результат будет звучать примерно вот так.
Это упражнение является частью курса
Обработка устной речи на Python
Инструкции к упражнению
- Импортируйте
AudioSegmentизPyDubиnormalizeиз модуля effects библиотекиPyDub. - Загрузите целевой аудиофайл
loud_then_quiet.wavи сохраните его в переменнуюloud_then_quiet. - Нормализуйте загруженный аудиофайл с помощью функции
normalize()и сохраните результат в переменнуюnormalized_loud_then_quiet.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____
# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)
# Normalize target audio file
normalized_loud_then_quiet = ____(____)