ПочатиПочніть безкоштовно

Попередня обробка тексту з AutoTokenizer

Ви створюєте застосунок для точного землеробства, щоб фермери могли ставити запитання щодо проблем, із якими стикаються в полі. Ви використаєте набір даних із поширеними запитаннями та відповідями на типові проблеми фермерів; поля цього набору даних:

  • question: поширені аграрні запитання
  • answers: відповіді на аграрні запитання

Як перший крок у розподіленому навчанні ви почнете з попередньої обробки цього текстового набору даних.

Деякі дані вже завантажено:

  • dataset містить зразок набору даних із аграрними запитаннями та відповідями
  • AutoTokenizer імпортовано з transformers

Ця вправа є частиною курсу

Ефективне тренування моделей ШІ з PyTorch

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натренований tokenizer.
  • Токенізуйте example["question"], використовуючи tokenizer.
  • Застосуйте функцію encode() до dataset.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
Редагувати та запускати код