今まで構築したモデルがデータにどれだけ当てはまっているかを確認したいと思います。そのために、実際の収益と予測収益の差の絶対値の中央値を計算します。次のコードを実行します。
median(abs(biopics$earnings - model_1$fitted.values), na.rm = TRUE)
結果はどうなると思いますか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、データセットの分析において欠損データがなぜリスクになるかを学びます。欠損データの3つのメカニズムを紹介し、統計的検定と可視化ツールを使ってそれらを見分ける方法を習得します。
現在の演習
補完手法の分類体系を学び、平均値補完、ホットデック補完、k近傍法補完という3つのドナーベース手法を習得します。各手法の仕組みを詳しく確認したうえで、実際の熱帯地域の気象データセットへの適用方法を学びます。また、これらの手法をより効果的に活用するための実践的なコツも紹介します。
線形回帰、ロジスティック回帰、ランダムフォレストなどの統計モデルや機械学習モデルを使って欠損データを補完する方法を学びましょう。この章では、モデルがどのように予測を行うかを深く理解し、その知識をもとに条件付き分布から補完値を導出する方法を習得します。これにより、補完値がより多様かつ妥当なものになり、実際のデータに近い結果が得られます。
補完値は確定した値ではありません。あくまで推定値であり、推定には必ず不確実性が伴います。この最終章では、ブートストラップ法と `mice` パッケージを使った連鎖方程式法により、補完の不確実性をモデルや分析に組み込み、結果をより信頼性の高いものにする方法を学びます。