AutoTokenizer로 텍스트 토크나이징하기
AutoTokenizer는 정제, 정규화, 토크나이징을 자동으로 처리해 텍스트 준비 과정을 단순화해요. 이렇게 하면 모델이 기대하는 방식대로 텍스트가 처리되도록 보장합니다.
이 연습 문제에서는 AutoTokenizer가 텍스트를 Machine Learning 작업에 사용할 수 있는 토큰으로 어떻게 변환하는지 살펴보세요.
이 연습은 강의의 일부입니다
Hugging Face 활용하기
연습 안내
transformers에서 필요한 클래스를 import하고, 올바른 메서드로 토크나이저를 로드한 다음, 입력 텍스트를 토큰으로 분할하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")