ランダムフォレスト:可視化
次は予測結果をプロットします。勾配ブースティングモデルでは、予測値と実際の値の散布図、および残差の密度プロットを作成しました。ここでは、両モデルの結果を一度に表示できるよう、それらのプロットを応用しましょう。
この演習はコースの一部です
sparklyr を使った Spark 入門(R)
演習の手順
両モデルの予測年と実際の年を含むローカルのティブル both_responses はあらかじめ定義されています。
- 予測値と実際の値の散布図を更新してください。
both_responsesデータセットを使用してください。- 各モデルを異なる色で描画するために、色の美的属性を追加してください。
color = modelを使用します。 - 点をプロットする代わりに、
geom_smooth()を使って各モデルのスムーズな曲線を描画してください。
residualsという名前の残差のティブルを作成してください。both_responsesに対してmutate()を呼び出してください。- 新しい列の名前は
residualとします。 residualは予測値から実際の値を引いた値になります。
- 残差の密度プロットを更新してください。
- 各モデルを異なる色で描画するために、色の美的属性を追加してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# both_responses has been pre-defined
both_responses
# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
# Add a smoothed line
___ +
# Add a line at actual = predicted
geom_abline(intercept = 0, slope = 1)
# Create a tibble of residuals
residuals <- ___
# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
# Add a density curve
geom_density() +
# Add a vertical line through zero
geom_vline(xintercept = 0)