Nhận dạng giọng nói tự động
Trong bài tập này, bạn sẽ dùng AI để tự động chuyển âm thanh thành văn bản! Bạn sẽ tiếp tục làm việc với VCTK Corpus, bộ dữ liệu khoảng 44 giờ lời nói của người nói tiếng Anh với nhiều giọng khác nhau. Bạn sẽ dùng Whisper tiny của OpenAI, chỉ có 37M tham số, để tiền xử lý dữ liệu âm thanh VCTK và tạo ra văn bản tương ứng.
Bộ tiền xử lý âm thanh (processor) đã được nạp, cũng như mô-đun WhisperForConditionalGeneration. Một mẫu dữ liệu âm thanh (sample) cũng đã được chuẩn bị sẵn.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải mô hình pretrained
WhisperForConditionalGenerationbằng checkpointopenai/whisper-tiny. - Tiền xử lý điểm dữ liệu
samplevới tần số lấy mẫu yêu cầu là16000. - Sinh token từ mô hình bằng thuộc tính
.input_featurescủa input đã tiền xử lý.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)