Tokenizacja tekstu z AutoTokenizer
AutoTokenizer upraszcza przygotowanie tekstu, automatycznie obsługując czyszczenie, normalizację i tokenizację. Dzięki temu tekst jest przetwarzany dokładnie tak, jak oczekuje model.
W tym ćwiczeniu sprawdź, jak AutoTokenizer przekształca tekst w tokeny gotowe do zadań z uczenia maszynowego.
To ćwiczenie jest częścią kursu
Praca z Hugging Face
Instrukcje do ćwiczenia
- Zaimportuj wymaganą klasę z
transformers, wczytaj tokenizer przy użyciu odpowiedniej metody i podziel tekst wejściowy na tokeny.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")