映画レビューの語彙サイズ
この演習では、movies のレビュー・データセットのサンプルを使って、語彙(ボキャブラリ)のサイズを制限するさまざまな方法を練習します。1列目は review で型は object、2列目は label で、否定的なレビューは 0、肯定的なレビューは 1 です。
ここで使う3つの方法はいずれも、テキスト列を新しい数値列に変換し、各レビュー内で単語やフレーズが出現した回数を表現します。最終的に、各方法は新しい特徴量の数がそれぞれ異なる結果になります。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())