Zacznij terazZacznij za darmo

Prompting modeli językowo-wizyjnych (VLM)

W ciągu dwóch kolejnych ćwiczeń użyjesz modelu multimodalnego do analizy sentymentu artykułu prasowego i odpowiadającego mu zdjęcia nagłówkowego z zbioru danych BBC News na Hugging Face:

Karta zbioru danych BBC News

Na początek przygotujesz szablon czatu dla modelu, który zawiera zarówno obraz, jak i treść artykułu. Zbiór danych (dataset) oraz zdjęcie nagłówkowe (image) zostały już wczytane.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj treść artykułu (content) z punktu danych o indeksie 6 w zbiorze dataset.
  • Uzupełnij zapytanie tekstowe, wstawiając content do text_query za pomocą f-stringów.
  • Dodaj image oraz text_query do szablonu czatu, podając typ zawartości text_query jako "text".

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the news article content from datapoint 6
content = ____

# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."

# Add the text query dictionary to the chat template
chat_template = [
    {
        "role": "user",
        "content": [
            {
                "type": "image",
                "image": ____,
            },
            ____
        ],
    }
]
Edytuj i uruchom kod