ÎncepețiÎncepe gratuit

Tokenizarea textului cu AutoTokenizer

AutoTokenizer simplifică pregătirea textului prin curățare, normalizare și tokenizare automată. Astfel, textul este procesat exact în formatul pe care modelul îl așteaptă.

În acest exercițiu, explorează cum transformă AutoTokenizer textul în token-uri pregătite pentru sarcinile de învățare automată.

Acest exercițiu face parte din cursul

Lucrul cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa necesară din transformers, încarcă tokenizer-ul folosind metoda corectă și împarte textul de intrare în token-uri.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Editează și rulează codul