Kom igångKom igång gratis

Normalisera en ljudfil med PyDub

Ibland har du ljudfiler där talet är högt i vissa delar och tyst i andra. Den här variationen i volym kan försvåra transkriptionen.

Tur nog har PyDubs effects-modul en funktion som heter normalize(). Den hittar den maximala volymen i ett AudioSegment och justerar sedan resten av AudioSegment i proportion. Det innebär att de tysta partierna får ett volymlyft.

Du kan lyssna på ett exempel på en ljudfil som börjar högt och sedan blir tyst, loud_then_quiet.wav, här.

I den här övningen använder du normalize() för att normalisera volymen i filen, så att den låter mer som det här.

Den här övningen är en del av kursen

Taligenkänning i Python

Visa kurs

Övningsinstruktioner

  • Importera AudioSegment från PyDub och normalize från PyDubs effects-modul.
  • Importera måljudfilen loud_then_quiet.wav och spara den i variabeln loud_then_quiet.
  • Normalisera den importerade ljudfilen med funktionen normalize() och spara resultatet i normalized_loud_then_quiet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import AudioSegment and normalize
from pydub import ____
from pydub.effects import ____

# Import target audio file
loud_then_quiet = AudioSegment.from_file(____)

# Normalize target audio file
normalized_loud_then_quiet = ____(____)
Redigera och kör kod