查看数据
工作区中已加载数据集 salesData。它包含第 1 至第 3 个月的客户信息,另包含第 4 个月的销售额。下表对一些含义不太直观的变量做了说明。
| Variable | Description |
|---|---|
| id | 客户编号 |
| mostFreqStore | 最常购买的门店 |
| mostFreqCat | 最常购买的品类 |
| nCats | 不同品类的数量 |
| preferredBrand | 最常购买的品牌 |
| nBrands | 不同品牌的数量 |
已安装并加载 readr、dplyr、corrplot 和 ggplot2 包。
本练习是课程的一部分
用 R 进行市场营销分析的机器学习
练习说明
- 使用结构命令
str()来总览数据。 - 现在可视化过去 3 个月的连续自变量与本月销售额变量之间的相关性。请使用
cor()与corrplot()函数配合管道运算符。注意,合适的变量已为您选好。 - 另外,绘制箱线图,展示在分类变量
preferredBrand的不同水平下,salesThisMon的分布。对于分类自变量mostFreqStore,我们已为您做了同样的可视化。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))