Gợi ý cho Vision Language Models (VLMs)
Trong hai bài tập tiếp theo, bạn sẽ dùng một mô hình đa phương thức để phân tích cảm xúc của một bài báo và ảnh minh họa tiêu đề tương ứng từ BBC News dataset trên Hugging Face:

Để bắt đầu, bạn sẽ chuẩn bị một mẫu hội thoại cho mô hình bao gồm cả ảnh và bài báo. Dataset (dataset) và ảnh tiêu đề (image) đã được nạp sẵn.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải nội dung bài báo (
content) từ điểm dữ liệu ở chỉ số6trongdataset. - Hoàn thiện truy vấn văn bản để chèn
contentvàotext_querybằng f-strings. - Thêm
imagevàtext_queryvào mẫu hội thoại, trong đó chỉ định kiểu nội dung củatext_querylà"text".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the news article content from datapoint 6
content = ____
# Complete the text query
text_query = f"Does the news article have a positive, negative, or neutral impact on championship winning chances: {____}. Provide reasoning."
# Add the text query dictionary to the chat template
chat_template = [
{
"role": "user",
"content": [
{
"type": "image",
"image": ____,
},
____
],
}
]