НачатьНачать бесплатно

Токенизация текстового набора данных

Вы занимаетесь маркетинговым исследованием для сайта о путешествиях и хотите использовать существующий набор данных для дообучения модели классификации отзывов об отелях. Вы решаете воспользоваться библиотекой datasets.

Класс AutoTokenizer заранее импортирован из transformers, а функция load_dataset() — из datasets.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Добавьте padding в токенизатор, чтобы обрабатывать текст батчами одинакового размера.
  • Токенизируйте текстовые данные с помощью предобученного токенизатора GPT и заданной функции.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Редактировать и запускать код