टेक्स्ट टोकनाइज़ करना
इस अभ्यास में, आप flickr डेटासेट का उपयोग करेंगे, जिसमें 30,000 इमेज और उनसे जुड़ी कैप्शंस हैं, ताकि टेक्स्ट पर प्रीप्रोसेसिंग ऑपरेशंस कर सकें। यह उन मॉडलों के लिए ज़रूरी है जो text classification जैसे टास्क करते हैं। यह खास तौर पर मल्टी-मोडल एप्लिकेशंस में उपयोगी है, जहाँ Hugging Face मॉडल किसी इमेज के लिए कैप्शन की उपयुक्तता जाँचने में काम आते हैं।
डेटासेट (dataset) लोड कर दिया गया है और AutoTokenizer इम्पोर्ट कर लिया गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)