BaşlayınÜcretsiz başlayın

Metinden konuşmaya bir modeli ince ayar yapma

Bölgesel aksanları taklit etmek üzere bir metinden konuşmaya modelini ince ayar yapmak için, farklı aksanlara sahip İngilizce konuşurlar tarafından okunmuş yaklaşık 44 saatlik konuşma verisi içeren VCTK Corpus ile çalışacaksın.

dataset zaten yüklenip ön işlemden geçirildi ve SpeechT5ForTextToSpeech modülü ile Seq2SeqTrainingArguments ve Seq2SeqTrainer modülleri yüklendi. Bir veri birleştirici (data_collator) önceden tanımlandı.

Lütfen eğitici yapılandırması üzerinde .train() metodunu çağırma; bu ortamda kod zaman aşımına uğrar.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • SpeechT5ForTextToSpeech kullanarak microsoft/speecht5_tts önceden eğitilmiş modelini yükle.
  • Şu ayarlarla bir Seq2SeqTrainingArguments örneği oluştur: gradient_accumulation_steps değeri 8, learning_rate değeri 0.00001, warmup_steps değeri 500 ve max_steps değeri 4000.
  • Eğiticiyi yeni eğitim argümanları, sağlanan model, veri ve processor ile yapılandır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
Kodu Düzenle ve Çalıştır