Metinden konuşmaya bir modeli ince ayar yapma
Bölgesel aksanları taklit etmek üzere bir metinden konuşmaya modelini ince ayar yapmak için, farklı aksanlara sahip İngilizce konuşurlar tarafından okunmuş yaklaşık 44 saatlik konuşma verisi içeren VCTK Corpus ile çalışacaksın.
dataset zaten yüklenip ön işlemden geçirildi ve SpeechT5ForTextToSpeech modülü ile Seq2SeqTrainingArguments ve Seq2SeqTrainer modülleri yüklendi. Bir veri birleştirici (data_collator) önceden tanımlandı.
Lütfen eğitici yapılandırması üzerinde .train() metodunu çağırma; bu ortamda kod zaman aşımına uğrar.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
SpeechT5ForTextToSpeechkullanarakmicrosoft/speecht5_ttsönceden eğitilmiş modelini yükle.- Şu ayarlarla bir
Seq2SeqTrainingArgumentsörneği oluştur:gradient_accumulation_stepsdeğeri8,learning_ratedeğeri0.00001,warmup_stepsdeğeri500vemax_stepsdeğeri4000. - Eğiticiyi yeni eğitim argümanları, sağlanan
model, veri veprocessorile yapılandır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)