開始使用免費開始

找出最常見的字詞

在建立好特徵之後,最好先檢視一下,確認結果是否如你預期。這能讓你及早發現錯誤,也可能影響你接下來要做哪些特徵工程。

你在上一個練習擬合的向量化器(cv)以及由字詞計數組成的稀疏陣列(cv_trigram)已經在你的工作環境中可用。

本練習屬於課程

Feature Engineering for Machine Learning in Python

檢視課程

練習說明

  • 建立一個包含特徵(字詞計數)的 DataFrame。
  • 加總字詞出現次數,並列印出出現次數最高的前 5 個字詞。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
編輯並執行程式碼