評估影片生成效能
你可以使用多模態 CLIP 模型來評估你的影片生成管線效能,該模型會測試每個影片影格影像與提示詞之間的相似度。你將用它來評估上一個練習中所生成的影片,與提示詞的符合程度。
load_video() 函式已從 diffusers.utils 匯入供你使用。clip_score 模組也已從 torchmetrics 匯入。
本練習屬於課程
使用 Hugging Face 的多模態模型
練習說明
- 以
clip_score()指標建立一個名為clip_score_fn()的 CLIP 評分函式。 - 計算
frame_tensors中每個影格張量與prompt之間的 CLIP 分數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Setup CLIP scoring
clip_score_fn = partial(____, model_name_or_path="openai/clip-vit-base-patch32")
frame_tensors = []
for frame in frames:
frame = np.array(frame)
frame_int = (frame * 255).astype("uint8")
frame_tensor = torch.from_numpy(frame_int).permute(2, 0, 1)
frame_tensors.append(frame_tensor)
# Pass a list of CHW tensors as expected by clip_score
scores = clip_score_fn(____, [____] * len(frame_tensors)).detach().cpu().numpy()
avg_clip_score = round(np.mean(scores), 4)
print(f"Average CLIP score: {avg_clip_score}")