AutoTokenizer के साथ टेक्स्ट को टोकनाइज़ करना
AutoTokenizer टेक्स्ट की तैयारी को आसान बनाते हैं. ये अपने आप क्लीनिंग, नॉर्मलाइज़ेशन, और टोकनाइज़ेशन संभालते हैं. इससे टेक्स्ट ठीक उसी तरह प्रोसेस होता है जैसा मॉडल अपेक्षा करता है.
इस अभ्यास में, देखें कि AutoTokenizer टेक्स्ट को मशीन लर्निंग टास्क के लिए तैयार टोकन में कैसे बदलता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ काम करना
अभ्यास निर्देश
transformersसे आवश्यक क्लास को import करें, सही मेथड से टोकनाइज़र load करें, और इनपुट टेक्स्ट को टोकन में split करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")