開始使用免費開始

計數單字(I)

在記錄了較高層級的資訊之後,你可以開始根據每段文字的實際內容來建立特徵。一種做法是參考你在前面課程處理類別變數的方式。

  • 資料集中每個獨特的單字,各建立一個欄位。
  • 對於每筆資料,計算該單字出現的次數,並將計數填入對應欄位。

這些「計數」欄位之後就能用來訓練機器學習模型。

本練習屬於課程

Feature Engineering for Machine Learning in Python

檢視課程

練習說明

  • sklearn.feature_extraction.text 匯入 CountVectorizer
  • 建立 CountVectorizer 實例並指定給 cv
  • 將向量化器擬合到 text_clean 欄位。
  • 列印向量化器產生的特徵名稱。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
編輯並執行程式碼