Токенизация текста с помощью AutoTokenizer
AutoTokenizer упрощает подготовку текста, автоматически выполняя очистку, нормализацию и токенизацию. Это гарантирует, что текст будет обработан именно так, как ожидает модель.
В этом упражнении вы изучите, как AutoTokenizer преобразует текст в токены, готовые к использованию в задачах машинного обучения.
Это упражнение является частью курса
Работа с Hugging Face
Инструкции к упражнению
- Импортируйте необходимый класс из
transformers, загрузите токенизатор с помощью соответствующего метода и разбейте входной текст на токены.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")