始める無料で始める

はじめての欠損データ可視化

データのどこに欠損値があるかを把握するのは難しいことがあります。ここで可視化が大いに役立ちます。

vis_miss() 関数は、データ内の欠損の概要を可視化します。行を欠損パターンでクラスタリングする cluster = TRUE、列を欠損の多い順から少ない順へ並べ替える sort_miss = TRUE といったオプションもあります。

この演習はコースの一部です

Rでの欠損データの扱い方

コースを見る

演習の手順

naniarriskfactors データセットを使って、次を行ってください。

  • vis_miss() でデータの欠損状況を可視化します。
  • vis_miss()cluster = TRUE を指定して、欠損のクラスタを探索します。
  • vis_miss()sort_miss を使って、列を欠損の多い順に並べ替えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Visualize all of the missingness in the `riskfactors`  dataset
vis_miss(___)

# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)

# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
コードを編集して実行