ПочатиПочніть безкоштовно

Токенізація тексту за допомогою AutoTokenizer

AutoTokenizer спрощує підготовку тексту, автоматично виконуючи очищення, нормалізацію та токенізацію. Він гарантує, що текст обробляється саме так, як очікує модель.

У цій вправі ви дослідите, як AutoTokenizer перетворює текст на токени, готові для задач машинного навчання.

Ця вправа є частиною курсу

Робота з Hugging Face

Переглянути курс

Інструкції до вправи

  • Імпортуйте потрібний клас із transformers, завантажте токенайзер відповідним методом і розбийте вхідний текст на токени.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Редагувати та запускати код