開始使用免費開始

為 TED Talks 建立 tf-idf 向量

在這個練習中,你會拿到語料庫 ted,其中包含 500 段 TED Talks 的逐字稿。你的任務是為這些逐字稿產生 tf-idf 向量。

在後續的單元中,我們會用這些向量,根據逐字稿內容產生相似演講的推薦。

本練習屬於課程

Python 中文本特徵工程

檢視課程

練習說明

  • sklearn 匯入 TfidfVectorizer
  • 建立一個 TfidfVectorizer 物件,命名為 vectorizer
  • 使用 fit_transform() 方法,為 ted 產生 tfidf_matrix

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import TfidfVectorizer
from ____ import ____

# Create TfidfVectorizer object
____

# Generate matrix of word vectors
tfidf_matrix = vectorizer.____(____)

# Print the shape of tfidf_matrix
print(tfidf_matrix.shape)
編輯並執行程式碼