Tách token văn bản
Trong bài tập này, bạn sẽ dùng bộ dữ liệu flickr với 30.000 ảnh và các chú thích đi kèm để tiền xử lý văn bản. Điều này là cần thiết để các mô hình sử dụng cho những nhiệm vụ như phân loại văn bản. Việc này đặc biệt hữu ích cho các ứng dụng đa phương thức, nơi bạn có thể dùng các mô hình của Hugging Face để kiểm tra mức độ phù hợp của chú thích với ảnh liên quan.
Bộ dữ liệu (dataset) đã được tải và AutoTokenizer đã được nhập.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)