檢視資料
工作區中已載入資料集 salesData。它包含第 1 至第 3 個月的顧客資訊,僅有第 4 個月的銷售額。下表說明一些較不直觀的變數意義。
| Variable | Description |
|---|---|
| id | 顧客識別編號 |
| mostFreqStore | 最常購買的門市 |
| mostFreqCat | 最常購買的品類 |
| nCats | 不同品類的數量 |
| preferredBrand | 最常購買的品牌 |
| nBrands | 不同品牌的數量 |
套件 readr、dplyr、corrplot 與 ggplot2 已經安裝並載入。
本練習屬於課程
R 的行銷分析機器學習
練習說明
- 使用結構檢視指令
str()來快速了解資料概況。 - 接著,將過去 3 個月的連續解釋變數與本月的銷售變數之間的相關性視覺化。使用
cor()與corrplot(),並搭配管線運算子。注意,正確的變數已經替你選好。 - 另外,繪製
preferredBrand類別不同水準下salesThisMon分布的盒鬚圖。對於類別依變數mostFreqStore的圖已經事先完成。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))