開始使用免費開始

含 n-grams 與詞彙量限制的 BOW

在這個練習中,你會再次練習建立 bag-of-words,使用 Amazon 產品評論的 reviews 資料集。你的主要任務是限制詞彙表的大小,並指定權標序列的長度。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • sklearn 匯入向量化器。
  • 建立向量化器,並確保設定以下參數:詞彙表大小限制為 1000、只包含 bigrams,且忽略出現在超過 500 份文件中的詞彙。
  • 將向量化器擬合到 review 欄位。
  • 以 BOW 表示建立一個 DataFrame。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
編輯並執行程式碼