시작하기무료로 시작하기

텍스트 토크나이징

이 연습 문제에서는 30,000장의 이미지와 캡션이 연결된 flickr 데이터셋을 사용해 텍스트 전처리를 수행해 보겠습니다. 전처리는 텍스트 분류와 같은 작업에 모델을 활용하기 위해 꼭 필요합니다. 특히 멀티모달 애플리케이션에서, Hugging Face 모델을 사용해 이미지와 연결된 캡션의 적합성을 확인할 때 유용합니다.

데이터셋(dataset)은 이미 로드되어 있으며 AutoTokenizer도 임포트되어 있습니다.

이 연습은 강의의 일부입니다

Hugging Face로 배우는 멀티모달 모델

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
코드 편집 및 실행