НачатьНачать бесплатно

Токенизация текста с помощью AutoTokenizer

AutoTokenizer упрощает подготовку текста, автоматически выполняя очистку, нормализацию и токенизацию. Это гарантирует, что текст будет обработан именно так, как ожидает модель.

В этом упражнении вы изучите, как AutoTokenizer преобразует текст в токены, готовые к использованию в задачах машинного обучения.

Это упражнение является частью курса

Работа с Hugging Face

Посмотреть курс

Инструкции к упражнению

  • Импортируйте необходимый класс из transformers, загрузите токенизатор с помощью соответствующего метода и разбейте входной текст на токены.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Редактировать и запускать код