Токенізація тексту за допомогою AutoTokenizer
AutoTokenizer спрощує підготовку тексту, автоматично виконуючи очищення, нормалізацію та токенізацію. Він гарантує, що текст обробляється саме так, як очікує модель.
У цій вправі ви дослідите, як AutoTokenizer перетворює текст на токени, готові для задач машинного навчання.
Ця вправа є частиною курсу
Робота з Hugging Face
Інструкції до вправи
- Імпортуйте потрібний клас із
transformers, завантажте токенайзер відповідним методом і розбийте вхідний текст на токени.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")