TED Talk レコメンダー
この演習では、トークの書き起こしに基づいて TED Talk を提案するレコメンデーションシステムを作成します。すでに、トークのタイトル、類似度行列、indices シリーズを引数に取り、最も類似したトークのリストを返す get_recommendations() 関数が用意されています。indices はすでに提供済みです。
また、約 500 件の TED Talk の書き起こしを含む transcripts シリーズも用意されています。あなたのタスクは、各トークの書き起こしの tf-idf ベクトルに対するコサイン類似度行列を生成することです。
最後に、ブラジル人起業家 Bel Pesce による「5 ways to kill your dreams」というタイトルのトークに対するレコメンデーションを生成します。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
- 英語のストップワードを指定して
TfidfVectorizerを初期化し、tfidfという名前を付けます。 transcriptsに対してフィットして変換し、tfidf_matrixを作成します。tfidf_matrixからコサイン類似度行列cosine_simを生成します。get_recommendations()を使って、'5 ways to kill your dreams' に対するレコメンデーションを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize the TfidfVectorizer
tfidf = ____
# Construct the TF-IDF matrix
tfidf_matrix = ____
# Generate the cosine similarity matrix
cosine_sim = ____
# Generate recommendations
print(get_recommendations(____, ____, indices))