Zacznij terazZacznij za darmo

Tokenizacja tekstu z AutoTokenizer

AutoTokenizer upraszcza przygotowanie tekstu, automatycznie obsługując czyszczenie, normalizację i tokenizację. Dzięki temu tekst jest przetwarzany dokładnie tak, jak oczekuje model.

W tym ćwiczeniu sprawdź, jak AutoTokenizer przekształca tekst w tokeny gotowe do zadań z uczenia maszynowego.

To ćwiczenie jest częścią kursu

Praca z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj wymaganą klasę z transformers, wczytaj tokenizer przy użyciu odpowiedniej metody i podziel tekst wejściowy na tokeny.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Edytuj i uruchom kod