テキストのトークナイズ
この演習では、30,000枚の画像とそれに対応するキャプションを含む flickr データセットを使って、テキストの前処理を行います。これはテキスト分類などのタスクでモデルが利用できる形にするために必要です。特に、Hugging Face のモデルで画像に対するキャプションの適合性を確認できる、マルチモーダルなアプリケーションで役立ちます。
データセット(dataset)は読み込まれており、AutoTokenizer はインポート済みです。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)