書籍の説明文にTF-IDFを適用する
PyBooks は複数の書籍説明文を収集し、TF-IDF エンコーディング手法を使ってその中の重要語を特定したいと考えています。これにより、各書籍の特徴をより深く理解し、レコメンデーションシステムの改善につなげることを目指しています。
次のパッケージはすでにインポートされています: torch, torchtext.
この演習はコースの一部です
PyTorch で学ぶテキストの Deep Learning
演習の手順
sklearn.feature_extraction.textから、原文ドキュメントの集合を TF-IDF 特徴量の行列に変換するTfidfVectorizerクラスをインポートします。- このクラスのオブジェクトを作成し、それを使って
descriptionsを TF-IDF のベクトル行列にエンコードします。 vectorizerから最初の5つの特徴量名を取得して表示し、tfidf_encoded_descriptionsからエンコード済みのベクトルを表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])