開始使用免費開始

評估影片生成效能

你可以使用多模態 CLIP 模型來評估你的影片生成管線效能,該模型會測試每個影片影格影像與提示詞之間的相似度。你將用它來評估上一個練習中所生成的影片,與提示詞的符合程度。

load_video() 函式已從 diffusers.utils 匯入供你使用。clip_score 模組也已從 torchmetrics 匯入。

本練習屬於課程

使用 Hugging Face 的多模態模型

檢視課程

練習說明

  • clip_score() 指標建立一個名為 clip_score_fn() 的 CLIP 評分函式。
  • 計算 frame_tensors 中每個影格張量與 prompt 之間的 CLIP 分數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Setup CLIP scoring
clip_score_fn = partial(____, model_name_or_path="openai/clip-vit-base-patch32")

frame_tensors = []
for frame in frames:
    frame = np.array(frame)
    frame_int = (frame * 255).astype("uint8")
    frame_tensor = torch.from_numpy(frame_int).permute(2, 0, 1)
    frame_tensors.append(frame_tensor)

# Pass a list of CHW tensors as expected by clip_score
scores = clip_score_fn(____, [____] * len(frame_tensors)).detach().cpu().numpy()

avg_clip_score = round(np.mean(scores), 4)
print(f"Average CLIP score: {avg_clip_score}")
編輯並執行程式碼