Bắt đầu ngayBắt đầu miễn phí

Gợi ý cho Vision Language Models (VLMs)

Trong hai bài tập tiếp theo, bạn sẽ dùng một mô hình đa phương thức để phân tích cảm xúc của một bài báo và ảnh minh họa tiêu đề tương ứng từ BBC News dataset trên Hugging Face:

BBC News dataset card

Để bắt đầu, bạn sẽ chuẩn bị một mẫu hội thoại cho mô hình bao gồm cả ảnh và bài báo. Dataset (dataset) và ảnh tiêu đề (image) đã được nạp sẵn.

Bài tập này là một phần của khóa học

Mô hình đa phương thức với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Tải nội dung bài báo (content) từ điểm dữ liệu ở chỉ số 6 trong dataset.
  • Hoàn thiện truy vấn văn bản để chèn content vào text_query bằng f-strings.
  • Thêm imagetext_query vào mẫu hội thoại, trong đó chỉ định kiểu nội dung của text_query"text".

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the news article content from datapoint 6
content = ____

# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."

# Add the text query dictionary to the chat template
chat_template = [
    {
        "role": "user",
        "content": [
            {
                "type": "image",
                "image": ____,
            },
            ____
        ],
    }
]
Chỉnh sửa và Chạy Mã