Classification multimodale des sentiments avec Qwen
Il est temps d'intégrer votre invite avec le modèle Qwen2 Vision Language! Vous utiliserez le gabarit d'invite que vous avez créé précédemment, accessible sous chat_template.
Voyons ce que le modèle pense de cet article! Le modèle (vl_model) et le processeur (vl_model_processor) ont été chargés pour vous.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Utilisez le processeur pour prétraiter
chat_template. - Utilisez le modèle pour générer les identifiants de sortie, en limitant les nouveaux jetons à
500. - Decodez les identifiants générés tronqués, en sautant les jetons spéciaux.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
text = vl_model_processor.apply_chat_template(chat_template, tokenize=False, add_generation_prompt=True)
image_inputs, _ = process_vision_info(chat_template)
# Use the processor to preprocess the text and image
inputs = ____(
text=[____],
images=____,
padding=True,
return_tensors="pt",
)
# Use the model to generate the output IDs
generated_ids = vl_model.____(**inputs, ____)
generated_ids_trimmed = [out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)]
# Decode the generated IDs
output_text = vl_model_processor.____(
generated_ids_trimmed, skip_special_tokens=True
)
print(output_text[0])