開始使用免費開始

將 TF-IDF 應用到書籍描述

PyBooks 已經蒐集了數本書的描述,並希望用 TF-IDF 編碼技術找出其中的重要詞彙。透過這樣做,他們期望更了解每本書的獨特屬性,並協助改進書籍推薦系統。

以下套件已為你匯入:torchtorchtext

本練習屬於課程

Deep Learning for Text with PyTorch

檢視課程

練習說明

  • sklearn.feature_extraction.text 匯入 TfidfVectorizer 類別,將一組原始文件轉換成 TF-IDF 特徵矩陣。
  • 建立此類別的物件,並使用該物件將 descriptions 編碼為 TF-IDF 向量矩陣。
  • vectorizer 取得並顯示前 5 個特徵名稱,以及從 tfidf_encoded_descriptions 取得並顯示已編碼的向量。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
編輯並執行程式碼