Zacznij terazZacznij za darmo

Normalizacja pliku audio za pomocą PyDub

Czasem pliki audio zawierają fragmenty, w których mowa jest głośna, i takie, gdzie jest cicha. Taka zmienność głośności może utrudniać transkrypcję.

Na szczęście moduł effects biblioteki PyDub udostępnia funkcję normalize(), która wyszukuje maksymalną głośność w obiekcie AudioSegment, a następnie dostosowuje do niej pozostałe fragmenty. Dzięki temu cichsze partie uzyskują odpowiedni wzmocnienie głośności.

Możesz posłuchać przykładowego pliku audio, który zaczyna się głośno, a potem ścisza – loud_then_quiet.wavtutaj.

W tym ćwiczeniu użyjesz funkcji normalize(), aby wyrównać głośność pliku – efekt powinien brzmieć mniej więcej tak.

To ćwiczenie jest częścią kursu

Przetwarzanie mowy w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj AudioSegment z PyDub oraz normalize z modułu effects biblioteki PyDub.
  • Wczytaj docelowy plik audio loud_then_quiet.wav i zapisz go do zmiennej loud_then_quiet.
  • Znormalizuj wczytany plik audio za pomocą funkcji normalize() i zapisz wynik do zmiennej normalized_loud_then_quiet.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____

# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)

# Normalize target audio file
normalized_loud_then_quiet = ____(____)
Edytuj i uruchom kod