Metin belirteçleme (tokenizing)
Bu egzersizde, 30.000 görsel ve bunlara ait altyazılar (caption) içeren flickr veri kümesini kullanarak metin üzerinde ön işleme adımları uygulayacaksın. Bu, metin sınıflandırma gibi görevlerde modeller tarafından kullanılabilmesi için gereklidir. Özellikle, Hugging Face modellerinin bir görselle ilişkili altyazının uygunluğunu kontrol etmek için kullanılabildiği çoklu-ortam (multi-modal) uygulamalarında çok faydalıdır.
Veri kümesi (dataset) yüklendi ve AutoTokenizer içe aktarıldı.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)