始める無料で始める

テキストのトークナイズ

この演習では、30,000枚の画像とそれに対応するキャプションを含む flickr データセットを使って、テキストの前処理を行います。これはテキスト分類などのタスクでモデルが利用できる形にするために必要です。特に、Hugging Face のモデルで画像に対するキャプションの適合性を確認できる、マルチモーダルなアプリケーションで役立ちます。

データセット(dataset)は読み込まれており、AutoTokenizer はインポート済みです。

この演習はコースの一部です

Hugging Face で学ぶマルチモーダルモデル

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
コードを編集して実行