CommencezCommencez gratuitement

Créer des invites pour les modèles Vision-Langage (VLM)

Au cours des deux prochains exercices, vous utiliserez un modèle multimodal pour analyser le sentiment d'un article de presse et de l'image d'en-tête correspondante provenant du jeu de données BBC News sur Hugging Face :

BBC News dataset card

Pour commencer, vous préparerez un gabarit de clavardage pour le modèle qui inclut à la fois l'image et l'article. Le jeu de données (dataset) et l'image d'en-tête (image) ont été chargés.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Chargez le contenu de l'article (content) à partir du point de données à l'indice 6 dans dataset.
  • Complétez la requête textuelle pour insérer content dans text_query à l'aide des f-strings.
  • Ajoutez image et text_query au gabarit de clavardage, en précisant que le type de contenu de text_query est "text".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the news article content from datapoint 6
content = ____

# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."

# Add the text query dictionary to the chat template
chat_template = [
    {
        "role": "user",
        "content": [
            {
                "type": "image",
                "image": ____,
            },
            ____
        ],
    }
]
Modifier et exécuter le code