Normalisera en ljudfil med PyDub
Ibland har du ljudfiler där talet är högt i vissa delar och tyst i andra. Den här variationen i volym kan försvåra transkriptionen.
Tur nog har PyDubs effects-modul en funktion som heter normalize(). Den hittar den maximala volymen i ett AudioSegment och justerar sedan resten av AudioSegment i proportion. Det innebär att de tysta partierna får ett volymlyft.
Du kan lyssna på ett exempel på en ljudfil som börjar högt och sedan blir tyst, loud_then_quiet.wav, här.
I den här övningen använder du normalize() för att normalisera volymen i filen, så att den låter mer som det här.
Den här övningen är en del av kursen
Taligenkänning i Python
Övningsinstruktioner
- Importera
AudioSegmentfrånPyDubochnormalizefrånPyDubs effects-modul. - Importera måljudfilen
loud_then_quiet.wavoch spara den i variabelnloud_then_quiet. - Normalisera den importerade ljudfilen med funktionen
normalize()och spara resultatet inormalized_loud_then_quiet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____
# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)
# Normalize target audio file
normalized_loud_then_quiet = ____(____)