含 n-grams 與詞彙量限制的 BOW
在這個練習中,你會再次練習建立 bag-of-words,使用 Amazon 產品評論的 reviews 資料集。你的主要任務是限制詞彙表的大小,並指定權標序列的長度。
本練習屬於課程
Python 情感分析
練習說明
- 從
sklearn匯入向量化器。 - 建立向量化器,並確保設定以下參數:詞彙表大小限制為 1000、只包含 bigrams,且忽略出現在超過 500 份文件中的詞彙。
- 將向量化器擬合到
review欄位。 - 以 BOW 表示建立一個 DataFrame。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())