ПочатиПочніть безкоштовно

Токенізуйте текстовий набір даних

Ви працюєте над маркетинговим дослідженням для туристичного сайту й хочете використати наявний набір даних, щоб донавчити модель для класифікації відгуків про готелі. Ви вирішили скористатися бібліотекою datasets.

Клас AutoTokenizer попередньо імпортовано з transformers, а load_dataset() — з datasets.

Ця вправа є частиною курсу

Reinforcement Learning from Human Feedback (RLHF)

Переглянути курс

Інструкції до вправи

  • Додайте заповнення (padding) до токенайзера, щоб обробляти текст рівними пакетами.
  • Токенізуйте текстові дані за допомогою попередньо натренованого токенайзера GPT і визначеної функції.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Редагувати та запускати код