TED Talk の tf-idf ベクトル
この演習では、500 本の TED Talk の書き起こしを含むコーパス ted が用意されています。これらのトークに対して tf-idf ベクトルを作成してください。
後のレッスンでは、これらのベクトルを使って書き起こしに基づく類似トークのレコメンデーションを作成します。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
sklearnからTfidfVectorizerをインポートします。TfidfVectorizerオブジェクトを作成し、名前をvectorizerにします。fit_transform()メソッドを使ってtedのtfidf_matrixを生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import TfidfVectorizer
from ____ import ____
# Create TfidfVectorizer object
____
# Generate matrix of word vectors
tfidf_matrix = vectorizer.____(____)
# Print the shape of tfidf_matrix
print(tfidf_matrix.shape)