Začněte nyníZačněte zdarma

Tokenizace textu pomocí AutoTokenizer

AutoTokenizer zjednodušuje přípravu textu – automaticky se postará o čištění, normalizaci i tokenizaci. Díky tomu je text zpracován přesně tak, jak model očekává.

V tomto cvičení si vyzkoušíš, jak AutoTokenizer převádí text na tokeny připravené pro úlohy strojového učení.

Toto cvičení je součástí kurzu

Working with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Importuj potřebnou třídu z transformers, načti tokenizér správnou metodou a rozděl vstupní text na tokeny.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Upravit a spustit kód