找出遺漏值
在進行遺漏值補植之前,第一步是先確認資料裡是否有遺漏值,以及這些遺漏值是來自哪些群組。
針對你在課程中用過的同一個 restaurant_data 資料集,有名員工不小心把 65 張桌子的小費資料刪掉了。我們想知道:遺漏的小費筆數中,有多少來自有吸菸者的桌次,相對於沒有吸菸者的桌次。
你的任務是根據 smoker 變數對兩個資料集分組,計算各組中非遺漏值的數量,然後求出差異。
我們在這裡補植小費資料,是為了讓你練習本課教的觀念。從道德面來看,真實情境中不應該對財務資料進行補植,因為這可能被視為舞弊。
本練習屬於課程
使用 pandas 撰寫高效程式碼
練習說明
- 依吸菸狀態對資料分組。
- 計算各組中的非遺漏值數量。
- 列印各組的遺漏值數量。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)
# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()
# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)