Tokenizarea textului cu AutoTokenizer
AutoTokenizer simplifică pregătirea textului prin curățare, normalizare și tokenizare automată. Astfel, textul este procesat exact în formatul pe care modelul îl așteaptă.
În acest exercițiu, explorează cum transformă AutoTokenizer textul în token-uri pregătite pentru sarcinile de învățare automată.
Acest exercițiu face parte din cursul
Lucrul cu Hugging Face
Instrucțiuni pentru exercițiu
- Importă clasa necesară din
transformers, încarcă tokenizer-ul folosind metoda corectă și împarte textul de intrare în token-uri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")