始める無料で始める

新しい音声を生成する

Hugging Face の音声モデルを使いこなす総仕上げです!微調整済みモデルを使って、指定した話者の声で新しい音声を生成します。新しい音声のベースとなる話者は、VCTK Corpus から選びます。

datasetSpeechT5ForTextToSpeech モデル(model)はすでに読み込まれており、プロット用の make_spectogram() 関数も用意されています。

この演習はコースの一部です

Hugging Face で学ぶマルチモーダルモデル

コースを見る

演習の手順

  • テスト用 dataset のインデックス 5 から、サンプルの話者埋め込みを読み込みます。
  • 処理済みテキストから音声を生成します。inputsspeaker_embedding、および vocoder を指定してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
コードを編集して実行