始める無料で始める

TED Talk レコメンダー

この演習では、トークの書き起こしに基づいて TED Talk を提案するレコメンデーションシステムを作成します。すでに、トークのタイトル、類似度行列、indices シリーズを引数に取り、最も類似したトークのリストを返す get_recommendations() 関数が用意されています。indices はすでに提供済みです。

また、約 500 件の TED Talk の書き起こしを含む transcripts シリーズも用意されています。あなたのタスクは、各トークの書き起こしの tf-idf ベクトルに対するコサイン類似度行列を生成することです。

最後に、ブラジル人起業家 Bel Pesce による「5 ways to kill your dreams」というタイトルのトークに対するレコメンデーションを生成します。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • 英語のストップワードを指定して TfidfVectorizer を初期化し、tfidf という名前を付けます。
  • transcripts に対してフィットして変換し、tfidf_matrix を作成します。
  • tfidf_matrix からコサイン類似度行列 cosine_sim を生成します。
  • get_recommendations() を使って、'5 ways to kill your dreams' に対するレコメンデーションを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Initialize the TfidfVectorizer 
tfidf = ____

# Construct the TF-IDF matrix
tfidf_matrix = ____

# Generate the cosine similarity matrix
cosine_sim = ____
 
# Generate recommendations 
print(get_recommendations(____, ____, indices))
コードを編集して実行