始める無料で始める

砂糖含有量データセットの可視化

この演習では、清涼飲料水の砂糖含有量25件の測定値を、1次元の散布図として作成します。目的は、データセット内の明確なクラスタを可視化し、候補となる識別境界を見つける第一歩にすることです。

25件の砂糖含有量測定値は、データフレーム dfsugar_content 列に保存されています。df はあらかじめ読み込まれています。

この演習はコースの一部です

Rで学ぶSupport Vector Machines

コースを見る

演習の手順

  • ggplot2 パッケージを読み込みます。
  • データフレーム df の変数を一覧します。
  • 散布図コードを完成させます。データセット df を使い、サンプルの砂糖含有量を x 軸にプロットし(y は 0 に固定)、1次元の配置にします。
  • ggplot() のコードを書いて、df の砂糖含有量を散布図として表示します。高い砂糖含有量と低い砂糖含有量のサンプルに対応する、2つのはっきりしたクラスタが見つかりますか?

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load ggplot2
___

# Print variable names
___

# Plot sugar content along the x-axis
plot_df <- ggplot(data = __, aes(x = ___, y = ___)) + 
    geom_point() + 
    geom_text(aes(label = sugar_content), size = 2.5, vjust = 2, hjust = 0.5)

# Display plot
plot_df
コードを編集して実行