Prompting modeli językowo-wizyjnych (VLM)
W ciągu dwóch kolejnych ćwiczeń użyjesz modelu multimodalnego do analizy sentymentu artykułu prasowego i odpowiadającego mu zdjęcia nagłówkowego z zbioru danych BBC News na Hugging Face:

Na początek przygotujesz szablon czatu dla modelu, który zawiera zarówno obraz, jak i treść artykułu. Zbiór danych (dataset) oraz zdjęcie nagłówkowe (image) zostały już wczytane.
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Wczytaj treść artykułu (
content) z punktu danych o indeksie6w zbiorzedataset. - Uzupełnij zapytanie tekstowe, wstawiając
contentdotext_queryza pomocą f-stringów. - Dodaj
imageoraztext_querydo szablonu czatu, podając typ zawartościtext_queryjako"text".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the news article content from datapoint 6
content = ____
# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."
# Add the text query dictionary to the chat template
chat_template = [
{
"role": "user",
"content": [
{
"type": "image",
"image": ____,
},
____
],
}
]