為 TED Talks 建立 tf-idf 向量
在這個練習中,你會拿到語料庫 ted,其中包含 500 段 TED Talks 的逐字稿。你的任務是為這些逐字稿產生 tf-idf 向量。
在後續的單元中,我們會用這些向量,根據逐字稿內容產生相似演講的推薦。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 從
sklearn匯入TfidfVectorizer。 - 建立一個
TfidfVectorizer物件,命名為vectorizer。 - 使用
fit_transform()方法,為ted產生tfidf_matrix。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import TfidfVectorizer
from ____ import ____
# Create TfidfVectorizer object
____
# Generate matrix of word vectors
tfidf_matrix = vectorizer.____(____)
# Print the shape of tfidf_matrix
print(tfidf_matrix.shape)