データセットのクリーニング
心疾患データセットのような実データは、重複や欠損値を含むなど、しばしば汚れています。この演習では、本章で学んだスキルを使って心疾患データセットのデータクリーニングを行います。データセットはすでに読み込まれています。EDA の結果に基づき、一般的なクリーニング処理を特定し実行してください。具体的には、空の列を削除し、重複行をドロップし、心電図の指標に関わる restecg 列に対して欠損値の補完を行います。Pandas は pd としてインポート済みで、心疾患データセットは heart_disease_df という pandas の DataFrame に格納されています。
この演習はコースの一部です
End-to-End Machine Learning
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Drop empty columns
heart_disease_column_dropped = heart_disease_df.____(____, ____)