はじめての欠損データ可視化
データのどこに欠損値があるかを把握するのは難しいことがあります。ここで可視化が大いに役立ちます。
vis_miss() 関数は、データ内の欠損の概要を可視化します。行を欠損パターンでクラスタリングする cluster = TRUE、列を欠損の多い順から少ない順へ並べ替える sort_miss = TRUE といったオプションもあります。
この演習はコースの一部です
Rでの欠損データの扱い方
演習の手順
naniar の riskfactors データセットを使って、次を行ってください。
vis_miss()でデータの欠損状況を可視化します。vis_miss()にcluster = TRUEを指定して、欠損のクラスタを探索します。vis_miss()でsort_missを使って、列を欠損の多い順に並べ替えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Visualize all of the missingness in the `riskfactors` dataset
vis_miss(___)
# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)