ПочатиПочніть безкоштовно

Токенізація тексту

У цій вправі ви використаєте набір даних flickr, який містить 30 000 зображень і відповідні підписи, щоб виконати попередню обробку тексту. Це необхідно для використання моделями в задачах на кшталт класифікації тексту. Це особливо корисно для мультимодальних застосунків, де моделі Hugging Face можна використати, щоб перевірити доречність підпису до відповідного зображення.

Набір даних (dataset) уже завантажено, а AutoTokenizer імпортовано.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
Редагувати та запускати код