Odšumění audia
V tomto cvičení použiješ data z datasetu WHAM, který kombinuje řeč se šumem pozadí – a z toho vygeneruješ novou řeč v jiném hlase a bez šumu na pozadí!

Pole example_speech a vektor speaker_embedding nového hlasu jsou již načteny. K dispozici máš také předzpracovatel (processor) a vocoder (vocoder) spolu s modulem SpeechT5ForSpeechToSpeech. Pro vykreslení grafu je připravena funkce make_spectrogram().
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Načti přetrénovaný model
SpeechT5ForSpeechToSpeechpomocí checkpointumicrosoft/speecht5_vc. - Předzpracuj
example_speechse vzorkovací frekvencí16000. - Vygeneruj odšuměnou řeč pomocí
.generate_speech().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)