用 BOW 指定權重單位序列長度
我們在影片中看到,透過指定不同長度的權重單位(也就是所謂的 n-grams),可以更好地擷取脈絡,這點往往非常重要。
在這個練習中,你會使用一小部分 Amazon 商品評論。你的任務是用 review 欄位建立一個 BOW 詞彙表,並指定權重單位(token)序列的長度。
本練習屬於課程
Python 情感分析
練習說明
- 建立向量化器,將權重單位的序列長度指定為 unigram 和 bigram。
- 擬合(fit)向量化器。
- 轉換(transform)剛剛擬合好的向量化器。
- 在 DataFrame 中,務必正確指定欄位名稱。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())