НачатьНачать бесплатно

Предобработка аудионаборов данных

Вы улучшаете своё приложение для точного земледелия: теперь фермеры смогут управлять техникой с помощью голосовых команд. Система должна распознавать ключевые слова в таких командах, как «Turn on the sprinkler irrigation system».

Вы будете использовать набор данных для обнаружения ключевых слов, содержащий аудиозаписи отдельных слов, например «on». Выполните предобработку аудиофайлов, чтобы их можно было использовать с предобученной моделью Transformer!

Часть данных уже загружена:

  • dataset содержит обучающую выборку аудиофайлов. Разбиение train уже включено, поэтому указывать его при работе с dataset не нужно.
  • AutoFeatureExtractor импортирован из transformers.
  • model равен facebook/wav2vec2-base.
  • max_duration задан как 1 секунда.

Это упражнение является частью курса

Эффективное обучение моделей ИИ с PyTorch

Посмотреть курс

Инструкции к упражнению

  • Загрузите предобученный feature_extractor с помощью класса AutoFeatureExtractor.
  • Задайте sampling_rate, используя частоту дискретизации из feature_extractor.
  • Задайте max_length для audio_arrays с помощью max_duration.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
Редактировать и запускать код