Créer des invites pour les modèles Vision-Langage (VLM)
Au cours des deux prochains exercices, vous utiliserez un modèle multimodal pour analyser le sentiment d'un article de presse et de l'image d'en-tête correspondante provenant du jeu de données BBC News sur Hugging Face :

Pour commencer, vous préparerez un gabarit de clavardage pour le modèle qui inclut à la fois l'image et l'article. Le jeu de données (dataset) et l'image d'en-tête (image) ont été chargés.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Chargez le contenu de l'article (
content) à partir du point de données à l'indice6dansdataset. - Complétez la requête textuelle pour insérer
contentdanstext_queryà l'aide des f-strings. - Ajoutez
imageettext_queryau gabarit de clavardage, en précisant que le type de contenu detext_queryest"text".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the news article content from datapoint 6
content = ____
# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."
# Add the text query dictionary to the chat template
chat_template = [
{
"role": "user",
"content": [
{
"type": "image",
"image": ____,
},
____
],
}
]