시작하기무료로 시작하기

오디오 잡음 제거

이 연습 문제에서는 음성과 배경 소음을 섞은 WHAM 데이터셋을 사용해, 배경 소음을 제거하고 다른 목소리로 새로운 음성을 생성해 볼 거예요!

Spectrogram of noisy speech

새로운 목소리에 대한 example_speech 배열과 speaker_embedding 벡터는 이미 로드되어 있어요. 전처리기(processor)와 vocoder(vocoder), 그리고 SpeechT5ForSpeechToSpeech 모듈도 준비되어 있습니다. 스펙트로그램을 그리는 데 도움이 되는 make_spectrogram() 함수도 제공돼요.

이 연습은 강의의 일부입니다

Hugging Face로 배우는 멀티모달 모델

강의 보기

연습 안내

  • microsoft/speecht5_vc 체크포인트로 SpeechT5ForSpeechToSpeech 사전 학습 모델을 로드하세요.
  • example_speech를 샘플링 레이트 16000으로 전처리하세요.
  • .generate_speech()를 사용해 잡음이 제거된 음성을 생성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
코드 편집 및 실행