BaşlayınÜcretsiz başlayın

Otomatik konuşma tanıma

Bu egzersizde, sesi otomatik olarak metne dönüştürmek için AI kullanacaksın! Yine VCTK Corpus ile çalışacaksın; bu veri kümesi, farklı aksanlara sahip İngilizce konuşmacılardan yaklaşık 44 saatlik konuşma içerir. VCTK ses verisini önişlemek ve karşılık gelen metni üretmek için yalnızca 37M parametre içeren OpenAI'nin Whisper tiny modelini kullanacaksın.

Ses önişleyicisi (processor) ve WhisperForConditionalGeneration modülü yüklendi. Örnek bir ses veri noktası (sample) da hazır.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • openai/whisper-tiny denetim noktasını kullanarak WhisperForConditionalGeneration önceden eğitilmiş modelini yükle.
  • sample veri noktasını gerekli örnekleme hızı 16000 ile önişle.
  • Modelle, önişlenmiş girdilerin .input_features özniteliğini kullanarak token üret.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Kodu Düzenle ve Çalıştır