始める無料で始める

テキスト読み上げモデルのファインチューニング

英語話者のさまざまなアクセントで約44時間分の音声データを収録した VCTK Corpus を使い、地域ごとのアクセントを再現できるようにテキスト読み上げモデルをファインチューニングします。

dataset はすでに読み込みと前処理が完了しており、SpeechT5ForTextToSpeech モジュール、Seq2SeqTrainingArgumentsSeq2SeqTrainer モジュールも読み込まれています。データコラトラ(data_collator)も事前定義済みです。

この環境では時間切れになるため、トレーナー設定で .train() メソッドを呼び出さないでください。

この演習はコースの一部です

Hugging Face で学ぶマルチモーダルモデル

コースを見る

演習の手順

  • SpeechT5ForTextToSpeech を使って、事前学習済みモデル microsoft/speecht5_tts を読み込みます。
  • 次の設定で Seq2SeqTrainingArguments のインスタンスを作成します:gradient_accumulation_steps8learning_rate0.00001warmup_steps500max_steps4000 に設定します。
  • 新しいトレーニング引数と、提供された model、データ、processor を用いてトレーナーを構成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
コードを編集して実行