開始使用免費開始

文字分詞

在這個練習中,你會使用 flickr 資料集。它包含 30,000 張圖片與對應的標題,用來對文字進行前處理。這是讓模型可用於文字分類等任務所必須的步驟。這對多模態應用特別實用,你可以用 Hugging Face 的模型來檢查某張圖片的標題是否合適。

資料集(dataset)已載入,AutoTokenizer 也已匯入。

本練習屬於課程

使用 Hugging Face 的多模態模型

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load the first caption from the image at index 5
text = dataset[5]["____"][0]
print(text)
編輯並執行程式碼