Bắt đầu ngayBắt đầu miễn phí

Nhận dạng giọng nói tự động

Trong bài tập này, bạn sẽ dùng AI để tự động chuyển âm thanh thành văn bản! Bạn sẽ tiếp tục làm việc với VCTK Corpus, bộ dữ liệu khoảng 44 giờ lời nói của người nói tiếng Anh với nhiều giọng khác nhau. Bạn sẽ dùng Whisper tiny của OpenAI, chỉ có 37M tham số, để tiền xử lý dữ liệu âm thanh VCTK và tạo ra văn bản tương ứng.

Bộ tiền xử lý âm thanh (processor) đã được nạp, cũng như mô-đun WhisperForConditionalGeneration. Một mẫu dữ liệu âm thanh (sample) cũng đã được chuẩn bị sẵn.

Bài tập này là một phần của khóa học

Mô hình đa phương thức với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Tải mô hình pretrained WhisperForConditionalGeneration bằng checkpoint openai/whisper-tiny.
  • Tiền xử lý điểm dữ liệu sample với tần số lấy mẫu yêu cầu là 16000.
  • Sinh token từ mô hình bằng thuộc tính .input_features của input đã tiền xử lý.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Chỉnh sửa và Chạy Mã