Tokenisera text med AutoTokenizer
AutoTokenizers förenklar textförberedelse genom att automatiskt hantera rensning, normalisering och tokenisering. De säkerställer att texten bearbetas precis som modellen förväntar sig.
I den här övningen undersöker du hur AutoTokenizer omvandlar text till tokens som är redo för maskininlärningsuppgifter.
Den här övningen är en del av kursen
Arbeta med Hugging Face
Övningsinstruktioner
- Importera den nödvändiga klassen från
transformers, läs in tokeniseraren med rätt metod och dela upp indatatexten i tokens.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")