CommencezCommencez gratuitement

Classification multimodale des sentiments avec Qwen

Il est temps d'intégrer votre invite avec le modèle Qwen2 Vision Language! Vous utiliserez le gabarit d'invite que vous avez créé précédemment, accessible sous chat_template.

Voyons ce que le modèle pense de cet article! Le modèle (vl_model) et le processeur (vl_model_processor) ont été chargés pour vous.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Utilisez le processeur pour prétraiter chat_template.
  • Utilisez le modèle pour générer les identifiants de sortie, en limitant les nouveaux jetons à 500.
  • Decodez les identifiants générés tronqués, en sautant les jetons spéciaux.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

text = vl_model_processor.apply_chat_template(chat_template, tokenize=False, add_generation_prompt=True)
image_inputs, _ = process_vision_info(chat_template)

# Use the processor to preprocess the text and image
inputs = ____(
    text=[____],
    images=____,
    padding=True,
    return_tensors="pt",
)

# Use the model to generate the output IDs
generated_ids = vl_model.____(**inputs, ____)
generated_ids_trimmed = [out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)]

# Decode the generated IDs
output_text = vl_model_processor.____(
    generated_ids_trimmed, skip_special_tokens=True
)
print(output_text[0])
Modifier et exécuter le code