CommencezCommencez gratuitement

Reconnaissance automatique de la parole

Dans cet exercice, vous utilisez l'IA pour transcrire automatiquement de l'audio en texte ! Vous travaillerez de nouveau avec le VCTK Corpus, qui comprend environ 44 heures de parole prononcée par des anglophones avec divers accents. Vous utiliserez le modèle Whisper tiny d'OpenAI, qui ne contient que 37 M de paramètres, pour prétraiter les données audio de VCTK et générer le texte correspondant.

Le préprocesseur audio (processor) a été chargé, de même que le module WhisperForConditionalGeneration. Un exemple de donnée audio (sample) a déjà été chargé.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Chargez le modèle préentraîné WhisperForConditionalGeneration en utilisant le point de contrôle openai/whisper-tiny.
  • Prétraitez la donnée sample avec la fréquence d'échantillonnage requise de 16000.
  • Générez les jetons à partir du modèle en utilisant l'attribut .input_features des entrées prétraitées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Modifier et exécuter le code