カスタム画像編集
AI による画像生成はそれだけでも魅力的ですが、モデルによってはカスタム画像編集にも対応しています。これは、テキストプロンプトと元画像の両方を入力に取る、マルチモーダルな画像生成の一種です。StableDiffusionControlNetPipeline を使って、有名なゴッホの自画像を漫画キャラクターの Snoopy に変えてみましょう。

注意: 拡散モデルでの推論は時間がかかるため、生成済み画像をあらかじめ読み込んであります。異なるプロンプトを実行しても新しい画像は生成されません。
Canny フィルター版の画像(canny_image)は用意済みです。StableDiffusionControlNetPipeline と ControlNetModel クラスは diffusers ライブラリからインポートされています。ジェネレーターのリスト(generator)も作成済みです。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
lllyasviel/sd-controlnet-cannyチェックポイントからControlNetModelを読み込みます。- 提供された
controlnetを渡して、runwayml/stable-diffusion-v1-5チェックポイントからStableDiffusionControlNetPipelineを読み込みます。 - 用意された
prompt、canny_image、negative_prompt、generatorを使ってパイプラインを実行します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
## NOTE: no imports are required for this exercise
# Load a ControlNetModel from the pretrained checkpoint
controlnet = ____("____", torch_dtype=torch.float16)
# Load a pretrained StableDiffusionControlNetPipeline using the ControlNetModel
pipe = ____(
"____", controlnet=____, torch_dtype=torch.float16
)
pipe = pipe.to("cuda")
prompt = ["Snoopy, best quality, extremely detailed"]
# Run the pipeline
output = pipe(
____,
____,
negative_prompt=["monochrome, lowres, bad anatomy, worst quality, low quality"],
generator=____,
num_inference_steps=20,
)
plt.imshow(output.images[0])
plt.show()