Tiền xử lý âm thanh
Trong bài tập này, bạn sẽ học cách điều chỉnh tần số lấy mẫu của dữ liệu âm thanh, cũng như cách dùng bộ tiền xử lý tự động. Bạn sẽ làm việc với VCTK Corpus, bao gồm khoảng 44 giờ dữ liệu giọng nói từ 110 người nói tiếng Anh với nhiều giọng khác nhau.
dataset đã được nạp sẵn.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Lấy mẫu lại âm thanh về tần số 16.000 Hz trong dataset bằng phương thức
.cast_column(). - Tải bộ xử lý âm thanh (audio processor) dùng model pretrained
openai/whisper-small. - Tiền xử lý dữ liệu âm thanh của điểm dữ liệu đầu tiên, chỉ định cùng tần số lấy mẫu và
padding=True.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])