EmpezarEmpieza gratis

Explorando los datos

El conjunto de datos salesData está cargado en el espacio de trabajo. Contiene información de clientes para los meses uno a tres. Solo se incluyen las ventas del mes cuatro. La siguiente tabla describe algunas variables cuyo significado no es tan evidente.

Variable Descripción
id número de identificación del cliente
mostFreqStore tienda en la que la persona compró con más frecuencia
mostFreqCat categoría que la persona compró con más frecuencia
nCats número de categorías diferentes
preferredBrand marca que la persona compró con más frecuencia
nBrands número de marcas diferentes

Los paquetes readr, dplyr, corrplot y ggplot2 están instalados y cargados.

Este ejercicio forma parte del curso

Machine Learning para analítica de marketing en R

Ver curso

Instrucciones del ejercicio

  • Usa el comando de estructura str() para obtener una visión general de los datos.
  • Ahora visualiza la correlación de las variables explicativas continuas de los tres meses anteriores con la variable de ventas de este mes. Usa las funciones cor() y corrplot() y el operador pipe. Ten en cuenta que ya se han seleccionado las variables correctas por ti.
  • Además, crea un diagrama de cajas (boxplot) que muestre la distribución de salesThisMon en función de los niveles de la variable categórica preferredBrand. Lo mismo ya se ha hecho para la variable dependiente categórica mostFreqStore.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Editar y ejecutar código