Kom igångKom igång gratis

Tokenisera text med AutoTokenizer

AutoTokenizers förenklar textförberedelse genom att automatiskt hantera rensning, normalisering och tokenisering. De säkerställer att texten bearbetas precis som modellen förväntar sig.

I den här övningen undersöker du hur AutoTokenizer omvandlar text till tokens som är redo för maskininlärningsuppgifter.

Den här övningen är en del av kursen

Arbeta med Hugging Face

Visa kurs

Övningsinstruktioner

  • Importera den nödvändiga klassen från transformers, läs in tokeniseraren med rätt metod och dela upp indatatexten i tokens.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Redigera och kör kod