시작하기무료로 시작하기

텍스트 토크나이징

Hugging Face의 사전 학습된 모델을 활용하고, 고객 이탈(churn) 위험에 따라 상호작용을 분류할 수 있도록 회사 지원팀의 데이터를 사용해 파인튜닝하려고 합니다. 이렇게 하면 팀이 무엇을 먼저, 그리고 어떻게 대응해야 할지 우선순위를 정해 보다 선제적으로 업무에 임할 수 있어요.

텍스트를 토크나이즈하여 파인튜닝에 사용할 학습/테스트 데이터를 준비하세요.

AutoTokenizerAutoModelForSequenceClassification은 이미 로드되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 LLM 입문

강의 보기

연습 안내

  • 파인튜닝을 준비하기 위해 사전 학습된 모델과 토크나이저를 로드하세요.
  • train_data["interaction"]test_data["interaction"]를 모두 토크나이즈하고, padding 및 시퀀스 자르기를 활성화하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
코드 편집 및 실행