시작하기무료로 시작하기

텍스트 데이터셋 토크나이즈하기

여행 웹사이트의 시장 조사를 진행 중이며, 기존 데이터셋을 활용해 호텔 리뷰를 분류하는 모델을 파인튜닝하려고 해요. 이를 위해 datasets 라이브러리를 사용하기로 합니다.

transformersAutoTokenizer 클래스와 datasetsload_dataset()은 미리 임포트되어 있어요.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • 텍스트를 동일한 크기의 배치로 처리할 수 있도록 토크나이저에 패딩을 추가하세요.
  • 사전 학습된 GPT 토크나이저와 정의된 함수를 사용해 텍스트 데이터를 토크나이즈하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
코드 편집 및 실행