砂糖含有量データセットの可視化
この演習では、清涼飲料水の砂糖含有量25件の測定値を、1次元の散布図として作成します。目的は、データセット内の明確なクラスタを可視化し、候補となる識別境界を見つける第一歩にすることです。
25件の砂糖含有量測定値は、データフレーム df の sugar_content 列に保存されています。df はあらかじめ読み込まれています。
この演習はコースの一部です
Rで学ぶSupport Vector Machines
演習の手順
ggplot2パッケージを読み込みます。- データフレーム
dfの変数を一覧します。 - 散布図コードを完成させます。データセット
dfを使い、サンプルの砂糖含有量を x 軸にプロットし(y は 0 に固定)、1次元の配置にします。 ggplot()のコードを書いて、dfの砂糖含有量を散布図として表示します。高い砂糖含有量と低い砂糖含有量のサンプルに対応する、2つのはっきりしたクラスタが見つかりますか?
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load ggplot2
___
# Print variable names
___
# Plot sugar content along the x-axis
plot_df <- ggplot(data = __, aes(x = ___, y = ___)) +
geom_point() +
geom_text(aes(label = sugar_content), size = 2.5, vjust = 2, hjust = 0.5)
# Display plot
plot_df