來做一支影片!
現在換你動手,從文字提示完全生成一支影片!你會使用 CogVideoXPipeline 這個 pipeline,並用以下提示來引導生成:
一個機器人在跳機器人舞。舞池是彩色方格,且有一顆亮晶晶的鏡球。
注意:影片生成模型的推論可能需要很長時間,因此我們已為你預先載入產生好的影片。就算執行不同的提示,也不會產生新影片。
CogVideoXPipeline 類別已替你匯入完成。
本練習屬於課程
使用 Hugging Face 的多模態模型
練習說明
- 從
THUDM/CogVideoX-2b檢查點建立一個CogVideoXPipeline。 - 以提供的提示執行該 pipeline,並將推論步數設為
20、要產生的影格數設為20,以及 guidance scale 設為6。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
prompt = "A robot doing the robot dance. The dance floor has colorful squares and a glitterball."
# Create a CogVideoXPipeline
pipe = ____(
"____",
torch_dtype=torch.float16
)
# Run the pipeline with the provided prompt
video = pipe(
prompt=____,
num_inference_steps=____,
num_frames=____,
guidance_scale=____
)
video = video.frames[0]
video_path = export_to_video(video, "output.mp4", fps=8)
video = VideoFileClip(video_path)
video.write_gif("video_ex.gif")