Предобработка текста с помощью AutoTokenizer
Вы разрабатываете приложение для точного земледелия, которое позволит фермерам задавать вопросы о проблемах, возникающих в поле. Для этого вы будете использовать набор данных с типичными вопросами и ответами по агрономическим темам. Набор данных содержит следующие поля:
question: распространённые вопросы по сельскому хозяйствуanswers: ответы на эти вопросы
Первым шагом в распределённом обучении станет предобработка текстового набора данных.
Часть данных уже загружена:
datasetсодержит выборку вопросов и ответов по сельскому хозяйствуAutoTokenizerимпортирован изtransformers
Это упражнение является частью курса
Эффективное обучение моделей ИИ с PyTorch
Инструкции к упражнению
- Загрузите предобученный
tokenizer. - Токенизируйте
example["question"]с помощьюtokenizer. - Примените функцию
encode()кdataset.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)