始める無料で始める

書籍タイトルのBag-of-Words

PyBooks では、今後の分析に向けてエンコードが必要な書籍タイトルのリストがあります。データチームは、Bag of Words(BoW)モデルが最適なアプローチになり得ると考えています。

次のパッケージはすでにインポートされています:torchtorchtext

この演習はコースの一部です

PyTorch で学ぶテキストの Deep Learning

コースを見る

演習の手順

  • bag-of-words を実装するために CountVectorizer クラスをインポートします。
  • インポートしたクラスのオブジェクトを初期化し、そのオブジェクトを使って titles を行列表現に変換します。
  • get_feature_names_out() メソッドで最初の5つの特徴名とエンコード後のタイトルを抽出して表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
コードを編集して実行