計數單字(I)
在記錄了較高層級的資訊之後,你可以開始根據每段文字的實際內容來建立特徵。一種做法是參考你在前面課程處理類別變數的方式。
- 資料集中每個獨特的單字,各建立一個欄位。
- 對於每筆資料,計算該單字出現的次數,並將計數填入對應欄位。
這些「計數」欄位之後就能用來訓練機器學習模型。
本練習屬於課程
Feature Engineering for Machine Learning in Python
練習說明
- 從
sklearn.feature_extraction.text匯入CountVectorizer。 - 建立
CountVectorizer實例並指定給cv。 - 將向量化器擬合到
text_clean欄位。 - 列印向量化器產生的特徵名稱。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)