電影情節的 TF-IDF
我們將使用隨機挑選的電影情節來進行文件分群。在對文件進行分群之前,需要先清理不必要的雜訊(例如特殊字元與停用詞),並透過對文件做 TF-IDF 轉換為稀疏矩陣。
使用 TfidfVectorizer 類別,對儲存在清單 plots 中的電影情節進行 TF-IDF。remove_noise() 函式可作為 TfidfVectorizer 類別中的 tokenizer 使用。.fit_transform() 方法會將資料擬合到 TfidfVectorizer 物件,接著產生 TF-IDF 稀疏矩陣。
注意:執行 .fit_transform() 方法需要幾秒鐘。
本練習屬於課程
Python 中的叢集分析
練習說明
- 從
sklearn匯入TfidfVectorizer類別。 - 以最小與最大詞頻 0.1 與 0.75、以及最大特徵數 50,初始化
TfidfVectorizer類別。 - 在已初始化的
TfidfVectorizer類別上,使用fit_transform()方法並傳入清單 plots。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____