テキスト読み上げモデルのファインチューニング
英語話者のさまざまなアクセントで約44時間分の音声データを収録した VCTK Corpus を使い、地域ごとのアクセントを再現できるようにテキスト読み上げモデルをファインチューニングします。
dataset はすでに読み込みと前処理が完了しており、SpeechT5ForTextToSpeech モジュール、Seq2SeqTrainingArguments と Seq2SeqTrainer モジュールも読み込まれています。データコラトラ(data_collator)も事前定義済みです。
この環境では時間切れになるため、トレーナー設定で .train() メソッドを呼び出さないでください。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
SpeechT5ForTextToSpeechを使って、事前学習済みモデルmicrosoft/speecht5_ttsを読み込みます。- 次の設定で
Seq2SeqTrainingArgumentsのインスタンスを作成します:gradient_accumulation_stepsを8、learning_rateを0.00001、warmup_stepsを500、max_stepsを4000に設定します。 - 新しいトレーニング引数と、提供された
model、データ、processorを用いてトレーナーを構成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)