BaşlayınÜcretsiz başlayın

Metin belirteçleme (tokenizing)

Bu egzersizde, 30.000 görsel ve bunlara ait altyazılar (caption) içeren flickr veri kümesini kullanarak metin üzerinde ön işleme adımları uygulayacaksın. Bu, metin sınıflandırma gibi görevlerde modeller tarafından kullanılabilmesi için gereklidir. Özellikle, Hugging Face modellerinin bir görselle ilişkili altyazının uygunluğunu kontrol etmek için kullanılabildiği çoklu-ortam (multi-modal) uygulamalarında çok faydalıdır.

Veri kümesi (dataset) yüklendi ve AutoTokenizer içe aktarıldı.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
Kodu Düzenle ve Çalıştır