Tokenisation de texte
Dans cet exercice, vous utiliserez le jeu de données flickr, qui contient 30 000 images et leurs légendes, pour effectuer des opérations de prétraitement sur du texte. Cela est nécessaire pour l'utilisation par des modèles pour des tâches comme la classification de texte. C'est particulièrement utile pour les applications multimodales où les modèles Hugging Face peuvent vérifier si une légende convient à l'image associée.
Le jeu de données (dataset) a été chargé et AutoTokenizer a été importé.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)