Otomatik konuşma tanıma
Bu egzersizde, sesi otomatik olarak metne dönüştürmek için AI kullanacaksın! Yine VCTK Corpus ile çalışacaksın; bu veri kümesi, farklı aksanlara sahip İngilizce konuşmacılardan yaklaşık 44 saatlik konuşma içerir. VCTK ses verisini önişlemek ve karşılık gelen metni üretmek için yalnızca 37M parametre içeren OpenAI'nin Whisper tiny modelini kullanacaksın.
Ses önişleyicisi (processor) ve WhisperForConditionalGeneration modülü yüklendi. Örnek bir ses veri noktası (sample) da hazır.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
openai/whisper-tinydenetim noktasını kullanarakWhisperForConditionalGenerationönceden eğitilmiş modelini yükle.sampleveri noktasını gerekli örnekleme hızı16000ile önişle.- Modelle, önişlenmiş girdilerin
.input_featuresözniteliğini kullanarak token üret.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)