開始使用免費開始

用 BOW 指定權重單位序列長度

我們在影片中看到,透過指定不同長度的權重單位(也就是所謂的 n-grams),可以更好地擷取脈絡,這點往往非常重要。

在這個練習中,你會使用一小部分 Amazon 商品評論。你的任務是用 review 欄位建立一個 BOW 詞彙表,並指定權重單位(token)序列的長度。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 建立向量化器,將權重單位的序列長度指定為 unigram 和 bigram。
  • 擬合(fit)向量化器。
  • 轉換(transform)剛剛擬合好的向量化器。
  • 在 DataFrame 中,務必正確指定欄位名稱。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
編輯並執行程式碼