BaşlayınÜcretsiz başlayın

Ses ön işleme

Bu egzersizde, ses verisinin örnekleme hızını nasıl ayarlayacağını ve otomatik bir ön işleyiciyi nasıl kullanacağını öğreneceksin. VCTK Corpus ile çalışacaksın; bu veri kümesi, farklı aksanlara sahip 110 İngilizce konuşmacının yaklaşık 44 saatlik konuşma verisini içerir.

dataset zaten yüklendi.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • Veri kümesindeki sesi .cast_column() yöntemini kullanarak 16.000 Hz frekansa yeniden örnekle.
  • Önceden eğitilmiş openai/whisper-small modelini kullanarak ses işlemcisini yükle.
  • Aynı örnekleme hızını belirterek ve padding=True kullanarak ilk veri noktasının ses verisini ön işle.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
Kodu Düzenle ve Çalıştır