ÎncepețiÎncepe gratuit

Împărțirea audio stereo în mono cu PyDub

Dacă vrei să transcrii convorbiri telefonice, există șanse ca acestea să fi fost înregistrate în format stereo, cu câte un vorbitor pe fiecare canal.

Așa cum ai văzut, transcrierea unui fișier audio cu mai mulți vorbitori poate fi dificilă. O soluție este să împarți fișierul audio cu mai mulți vorbitori în fișiere separate, câte unul pentru fiecare vorbitor.

Funcția split_to_mono() din PyDub te poate ajuta în acest sens. Când este apelată pe un AudioSegment înregistrat în stereo, returnează o listă cu două AudioSegment-uri separate în format mono, câte unul pentru fiecare canal.

În acest exercițiu, vei exersa acest lucru împărțind această înregistrare a unui apel telefonic stereo (stereo_phone_call.wav) în canalul 1 și canalul 2. Astfel, cei doi vorbitori sunt separați, facilitând transcrierea.

Acest exercițiu face parte din cursul

Procesarea limbajului vorbit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă AudioSegment din pydub.
  • Creează o instanță AudioSegment numită stereo_phone_call folosind fișierul stereo_phone_call.wav.
  • Împarte stereo_phone_call în channels folosind split_to_mono() și verifică canalele rezultate.
  • Salvează fiecare canal în câte o variabilă nouă: phone_call_channel_1 și phone_call_channel_2.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import AudioSegment
from ____ import ____

# Import stereo audio file and check channels
stereo_phone_call = AudioSegment.from_file(____)
print(f"Stereo number channels: {stereo_phone_call.channels}")

# Split stereo phone call and check channels
channels = stereo_phone_call.____
print(f"Split number channels: {channels[0].____}, {channels[1].____}")

# Save new channels separately
phone_call_channel_1 = channels[0]
phone_call_channel_2 = ____
Editează și rulează codul