步驟 2:建立向量化器
在這個練習中,你要對 reviews 資料集中的 review 欄位建立 TfIDf 轉換。你需要指定 n-grams、停用詞、詞元(token)的樣式,以及字彙表大小等參數。
這是訓練分類器以預測評論情感之前的最後一步。
請務必正確設定最大特徵數。字彙表太大可能會讓你的工作階段中斷。
本練習屬於課程
Python 情感分析
練習說明
- 匯入 Tfidf 向量化器與英文停用詞的預設清單。
- 建立 Tfidf 向量化器,並依序指定以下參數:停用詞使用英文預設清單;n-grams 使用 uni-gram 與 bi-gram;最大特徵數為 200;只擷取符合指定樣式的英文字。
- 使用該 Tfidf 向量化器建立一個 DataFrame。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())