始める無料で始める

ステップ2:ベクトライザを作成する

この演習では、reviewsデータセットのreview列に対してTfIDf変換を作成します。n-gram、ストップワード、トークンのパターン、語彙のサイズの各引数を指定してください。

これは、レビューの感情を予測する分類器を学習させる直前の最後のステップです。

最大特徴量数を適切に設定してください。語彙サイズが大きすぎると、セッションが切断される可能性があります。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • Tfidfベクトライザと英語のデフォルトのストップワード一覧をインポートします。
  • 次の引数をこの順序で指定して、Tfidfベクトライザを作成します:ストップワードには英語のデフォルト一覧を使用する;n-gramはユニグラムとバイグラムを使用する;最大特徴量数は200にする;指定されたパターンで単語のみを抽出する。
  • 作成したTfidfベクトライザを使ってDataFrameを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
コードを編集して実行