ステップ2:ベクトライザを作成する
この演習では、reviewsデータセットのreview列に対してTfIDf変換を作成します。n-gram、ストップワード、トークンのパターン、語彙のサイズの各引数を指定してください。
これは、レビューの感情を予測する分類器を学習させる直前の最後のステップです。
最大特徴量数を適切に設定してください。語彙サイズが大きすぎると、セッションが切断される可能性があります。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
演習の手順
- Tfidfベクトライザと英語のデフォルトのストップワード一覧をインポートします。
- 次の引数をこの順序で指定して、Tfidfベクトライザを作成します:ストップワードには英語のデフォルト一覧を使用する;n-gramはユニグラムとバイグラムを使用する;最大特徴量数は200にする;指定されたパターンで単語のみを抽出する。
- 作成したTfidfベクトライザを使ってDataFrameを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())