НачатьНачать бесплатно

Предобработка текста с помощью AutoTokenizer

Вы разрабатываете приложение для точного земледелия, которое позволит фермерам задавать вопросы о проблемах, возникающих в поле. Для этого вы будете использовать набор данных с типичными вопросами и ответами по агрономическим темам. Набор данных содержит следующие поля:

  • question: распространённые вопросы по сельскому хозяйству
  • answers: ответы на эти вопросы

Первым шагом в распределённом обучении станет предобработка текстового набора данных.

Часть данных уже загружена:

  • dataset содержит выборку вопросов и ответов по сельскому хозяйству
  • AutoTokenizer импортирован из transformers

Это упражнение является частью курса

Эффективное обучение моделей ИИ с PyTorch

Посмотреть курс

Инструкции к упражнению

  • Загрузите предобученный tokenizer.
  • Токенизируйте example["question"] с помощью tokenizer.
  • Примените функцию encode() к dataset.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
Редактировать и запускать код