始める無料で始める

クラスタを可視化する

ここまでで、観測値と、クラスタを表す楕円を一緒にプロットするために必要な準備が整いました。

また、各観測値を2つのクラスタのいずれかに割り当てたい場合は、clusters() 関数を使って結果を実ラベルと比較できます。念のため振り返ると、変数 Weight のみでクラスタリングしたときは、4500 人の女性と 4556 人の男性を正しく予測できました。追加の変数を取り入れたとき、よりうまくクラスタを分離できるか見てみましょう。

この演習はコースの一部です

R で学ぶ Mixture Models

コースを見る

演習の手順

  • geom_point() を使って、WeightBMI の散布図を作成します。このプロットに、geom_path()ellipses_comp_number に保存した2つの楕円を追加します。
  • 楕円はデータフレームに変換してから使用してください。
  • クラスタ1は赤、クラスタ2は青で色付けします。
  • 変数 Gender に格納された実ラベルと、clusters が推定した予測ラベルのクロス集計表(度数表)を作成して評価します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
コードを編集して実行