找出最常見的字詞
在建立好特徵之後,最好先檢視一下,確認結果是否如你預期。這能讓你及早發現錯誤,也可能影響你接下來要做哪些特徵工程。
你在上一個練習擬合的向量化器(cv)以及由字詞計數組成的稀疏陣列(cv_trigram)已經在你的工作環境中可用。
本練習屬於課程
Feature Engineering for Machine Learning in Python
練習說明
- 建立一個包含特徵(字詞計數)的 DataFrame。
- 加總字詞出現次數,並列印出出現次數最高的前 5 個字詞。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())