Tokenizace textu pomocí AutoTokenizer
AutoTokenizer zjednodušuje přípravu textu – automaticky se postará o čištění, normalizaci i tokenizaci. Díky tomu je text zpracován přesně tak, jak model očekává.
V tomto cvičení si vyzkoušíš, jak AutoTokenizer převádí text na tokeny připravené pro úlohy strojového učení.
Toto cvičení je součástí kurzu
Working with Hugging Face
Pokyny k cvičení
- Importuj potřebnou třídu z
transformers, načti tokenizér správnou metodou a rozděl vstupní text na tokeny.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")