クラスタを可視化する
ここまでで、観測値と、クラスタを表す楕円を一緒にプロットするために必要な準備が整いました。
また、各観測値を2つのクラスタのいずれかに割り当てたい場合は、clusters() 関数を使って結果を実ラベルと比較できます。念のため振り返ると、変数 Weight のみでクラスタリングしたときは、4500 人の女性と 4556 人の男性を正しく予測できました。追加の変数を取り入れたとき、よりうまくクラスタを分離できるか見てみましょう。
この演習はコースの一部です
R で学ぶ Mixture Models
演習の手順
geom_point()を使って、WeightとBMIの散布図を作成します。このプロットに、geom_path()でellipses_comp_numberに保存した2つの楕円を追加します。- 楕円はデータフレームに変換してから使用してください。
- クラスタ1は赤、クラスタ2は青で色付けします。
- 変数
Genderに格納された実ラベルと、clustersが推定した予測ラベルのクロス集計表(度数表)を作成して評価します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))