開始使用免費開始

步驟 2:建立向量化器

在這個練習中,你要對 reviews 資料集中的 review 欄位建立 TfIDf 轉換。你需要指定 n-grams、停用詞、詞元(token)的樣式,以及字彙表大小等參數。

這是訓練分類器以預測評論情感之前的最後一步。

請務必正確設定最大特徵數。字彙表太大可能會讓你的工作階段中斷。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 匯入 Tfidf 向量化器與英文停用詞的預設清單。
  • 建立 Tfidf 向量化器,並依序指定以下參數:停用詞使用英文預設清單;n-grams 使用 uni-gram 與 bi-gram;最大特徵數為 200;只擷取符合指定樣式的英文字。
  • 使用該 Tfidf 向量化器建立一個 DataFrame。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
編輯並執行程式碼