Normalizacja pliku audio za pomocą PyDub
Czasem pliki audio zawierają fragmenty, w których mowa jest głośna, i takie, gdzie jest cicha. Taka zmienność głośności może utrudniać transkrypcję.
Na szczęście moduł effects biblioteki PyDub udostępnia funkcję normalize(), która wyszukuje maksymalną głośność w obiekcie AudioSegment, a następnie dostosowuje do niej pozostałe fragmenty. Dzięki temu cichsze partie uzyskują odpowiedni wzmocnienie głośności.
Możesz posłuchać przykładowego pliku audio, który zaczyna się głośno, a potem ścisza – loud_then_quiet.wav – tutaj.
W tym ćwiczeniu użyjesz funkcji normalize(), aby wyrównać głośność pliku – efekt powinien brzmieć mniej więcej tak.
To ćwiczenie jest częścią kursu
Przetwarzanie mowy w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
AudioSegmentzPyDuboraznormalizez modułu effects bibliotekiPyDub. - Wczytaj docelowy plik audio
loud_then_quiet.wavi zapisz go do zmiennejloud_then_quiet. - Znormalizuj wczytany plik audio za pomocą funkcji
normalize()i zapisz wynik do zmiennejnormalized_loud_then_quiet.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____
# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)
# Normalize target audio file
normalized_loud_then_quiet = ____(____)