Začněte nyníZačněte zdarma

Tokenizace textu

V tomto cvičení použiješ dataset flickr, který obsahuje 30 000 obrázků a jejich popisky, a provedeš předběžné zpracování textu. To je nezbytný krok, aby mohly modely text využít například při klasifikaci. Hodí se to zejména pro multimodální aplikace, kde Hugging Face modely dokážou ověřit, jestli popisek odpovídá přiřazenému obrázku.

Dataset (dataset) je načtený a třída AutoTokenizer je importována.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
Upravit a spustit kód