データを見てみましょう
ワークスペースにはデータセットsalesDataが読み込まれています。これは、1~3か月目の顧客情報を含み、4か月目は売上のみが含まれます。意味が分かりにくい変数については、次の表で説明します。
| Variable | Description |
|---|---|
| id | 顧客の識別番号 |
| mostFreqStore | 最もよく購入した店舗 |
| mostFreqCat | 最もよく購入したカテゴリ |
| nCats | 購入した異なるカテゴリ数 |
| preferredBrand | 最もよく購入したブランド |
| nBrands | 購入した異なるブランド数 |
パッケージreadr、dplyr、corrplot、ggplot2はすでにインストール済みで読み込まれています。
この演習はコースの一部です
Rで学ぶマーケティングアナリティクスのための機械学習
演習の手順
- データの概要を確認するために、構造を表示するコマンド
str()を使いましょう。 - 次に、過去3か月の連続型の説明変数と今月の売上変数との相関を可視化します。関数
cor()とcorrplot()、そしてパイプ演算子を使ってください。適切な変数の選択はすでに行われています。 - さらに、カテゴリ変数
preferredBrandの水準ごとのsalesThisMonの分布を示す箱ひげ図を作成します。カテゴリ変数の従属変数mostFreqStoreについては、同様の図がすでに用意されています。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))