Попередня обробка тексту з AutoTokenizer
Ви створюєте застосунок для точного землеробства, щоб фермери могли ставити запитання щодо проблем, із якими стикаються в полі. Ви використаєте набір даних із поширеними запитаннями та відповідями на типові проблеми фермерів; поля цього набору даних:
question: поширені аграрні запитанняanswers: відповіді на аграрні запитання
Як перший крок у розподіленому навчанні ви почнете з попередньої обробки цього текстового набору даних.
Деякі дані вже завантажено:
datasetмістить зразок набору даних із аграрними запитаннями та відповідямиAutoTokenizerімпортовано зtransformers
Ця вправа є частиною курсу
Ефективне тренування моделей ШІ з PyTorch
Інструкції до вправи
- Завантажте попередньо натренований
tokenizer. - Токенізуйте
example["question"], використовуючиtokenizer. - Застосуйте функцію
encode()доdataset.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)