パイプラインでキャプション生成
この演習では、30,000枚の画像とそのキャプションを含む flickr データセットをもう一度使います。今回は、auto クラスではなくパイプラインを使って、次の画像に対するキャプションを生成します。

データセット(dataset)は次の構造で読み込まれています。
Dataset({
features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
num_rows: 10
})
パイプラインモジュール(pipeline)は読み込まれています。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
Salesforce/blip-image-captioning-baseの事前学習済みモデルでimage-to-textパイプラインを読み込みます。- インデックス
3の画像に対して、パイプラインでキャプションを生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the image-to-text pipeline
pipe = pipeline(task="____", model="____")
# Use the pipeline to generate a caption with the image of datapoint 3
pred = ____(dataset[3]["____"])
print(pred)