開始使用免費開始

電影情節的 TF-IDF

我們將使用隨機挑選的電影情節來進行文件分群。在對文件進行分群之前,需要先清理不必要的雜訊(例如特殊字元與停用詞),並透過對文件做 TF-IDF 轉換為稀疏矩陣。

使用 TfidfVectorizer 類別,對儲存在清單 plots 中的電影情節進行 TF-IDF。remove_noise() 函式可作為 TfidfVectorizer 類別中的 tokenizer 使用。.fit_transform() 方法會將資料擬合到 TfidfVectorizer 物件,接著產生 TF-IDF 稀疏矩陣。

注意:執行 .fit_transform() 方法需要幾秒鐘。

本練習屬於課程

Python 中的叢集分析

檢視課程

練習說明

  • sklearn 匯入 TfidfVectorizer 類別。
  • 以最小與最大詞頻 0.1 與 0.75、以及最大特徵數 50,初始化 TfidfVectorizer 類別。
  • 在已初始化的 TfidfVectorizer 類別上,使用 fit_transform() 方法並傳入清單 plots。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
編輯並執行程式碼