ПочатиПочніть безкоштовно

Тонке налаштування моделі перетворення тексту на мовлення

Ви працюватимете з VCTK Corpus, який містить близько 44 годин мовних даних, начитаних англомовними дикторами з різними акцентами, щоб виконати тонке налаштування моделі перетворення тексту на мовлення для відтворення регіональних акцентів.

dataset уже завантажено та попередньо оброблено, модуль SpeechT5ForTextToSpeech завантажено, так само як і модулі Seq2SeqTrainingArguments і Seq2SeqTrainer. Колатор даних (data_collator) попередньо визначено.

Будь ласка, не викликайте метод .train() у конфігурації тренера, оскільки цей код перевищить ліміт часу в цьому середовищі.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натреновану модель microsoft/speecht5_tts за допомогою SpeechT5ForTextToSpeech.
  • Створіть екземпляр Seq2SeqTrainingArguments із такими параметрами: gradient_accumulation_steps дорівнює 8, learning_rate дорівнює 0.00001, warmup_steps дорівнює 500, а max_steps дорівнює 4000.
  • Налаштуйте тренер з новими параметрами навчання, а також з наданими model, даними та processor.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
Редагувати та запускати код