將 TF-IDF 應用到書籍描述
PyBooks 已經蒐集了數本書的描述,並希望用 TF-IDF 編碼技術找出其中的重要詞彙。透過這樣做,他們期望更了解每本書的獨特屬性,並協助改進書籍推薦系統。
以下套件已為你匯入:torch、torchtext。
本練習屬於課程
Deep Learning for Text with PyTorch
練習說明
- 從
sklearn.feature_extraction.text匯入TfidfVectorizer類別,將一組原始文件轉換成 TF-IDF 特徵矩陣。 - 建立此類別的物件,並使用該物件將
descriptions編碼為 TF-IDF 向量矩陣。 - 從
vectorizer取得並顯示前 5 個特徵名稱,以及從tfidf_encoded_descriptions取得並顯示已編碼的向量。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])