Нормалізація аудіофайла за допомогою PyDub
Іноді трапляються аудіофайли, де в одних місцях мовлення гучне, а в інших — тихе. Така різниця в гучності може заважати транскрибуванню.
На щастя, у модулі ефектів PyDub є функція normalize(), яка знаходить максимальну гучність AudioSegment, а потім підлаштовує решту AudioSegment пропорційно. Це означає, що тихі частини стануть голоснішими.
Ви можете прослухати приклад аудіофайла, який починається гучно, а потім стихає — loud_then_quiet.wav — тут.
У цій вправі ви використаєте normalize(), щоб вирівняти гучність нашого файла — щоб він звучав приблизно так.
Ця вправа є частиною курсу
Обробка усного мовлення в Python
Інструкції до вправи
- Імпортуйте
AudioSegmentзPyDubіnormalizeз модуля ефектівPyDub. - Імпортуйте цільовий аудіофайл
loud_then_quiet.wavі збережіть його вloud_then_quiet. - Нормалізуйте імпортований аудіофайл за допомогою функції
normalize()і збережіть результат уnormalized_loud_then_quiet.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____
# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)
# Normalize target audio file
normalized_loud_then_quiet = ____(____)