Explorando los datos
El conjunto de datos salesData está cargado en el espacio de trabajo. Contiene información de clientes para los meses uno a tres. Solo se incluyen las ventas del mes cuatro. La siguiente tabla describe algunas variables cuyo significado no es tan evidente.
| Variable | Descripción |
|---|---|
| id | número de identificación del cliente |
| mostFreqStore | tienda en la que la persona compró con más frecuencia |
| mostFreqCat | categoría que la persona compró con más frecuencia |
| nCats | número de categorías diferentes |
| preferredBrand | marca que la persona compró con más frecuencia |
| nBrands | número de marcas diferentes |
Los paquetes readr, dplyr, corrplot y ggplot2 están instalados y cargados.
Este ejercicio forma parte del curso
Machine Learning para analítica de marketing en R
Instrucciones del ejercicio
- Usa el comando de estructura
str()para obtener una visión general de los datos. - Ahora visualiza la correlación de las variables explicativas continuas de los tres meses anteriores con la variable de ventas de este mes. Usa las funciones
cor()ycorrplot()y el operador pipe. Ten en cuenta que ya se han seleccionado las variables correctas por ti. - Además, crea un diagrama de cajas (boxplot) que muestre la distribución de
salesThisMonen función de los niveles de la variable categóricapreferredBrand. Lo mismo ya se ha hecho para la variable dependiente categóricamostFreqStore.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))