ПочатиПочніть безкоштовно

Попередня обробка аудіонаборів даних

Ви вдосконалюєте застосунок для точного землеробства, додаючи можливість керувати технікою голосовими командами. Система має розпізнавати ключові слова в командах на кшталт «Увімкни систему дощування».

Ви скористаєтеся набором даних для виявлення ключових слів з аудіофрагментами слів, наприклад «on». Виконайте попередню обробку аудіофайлів, щоб їх можна було використати з попередньо натренованою моделлю Transformer!

Деякі дані вже завантажено:

  • dataset містить зразок тренувального набору аудіофайлів. Він уже має розбиття train, тож вам не потрібно вказувати train, коли ви використовуєте dataset.
  • AutoFeatureExtractor імпортовано з transformers.
  • model дорівнює facebook/wav2vec2-base.
  • max_duration визначено як 1 секунда.

Ця вправа є частиною курсу

Ефективне тренування моделей ШІ з PyTorch

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натренований feature_extractor за допомогою класу AutoFeatureExtractor.
  • Встановіть sampling_rate, використовуючи частоти з feature_extractor.
  • Задайте max_length для audio_arrays, використовуючи max_duration.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
Редагувати та запускати код