EmpezarEmpieza gratis

Agrupar variables por proporción

Muchas veces no tendrás niveles concretos que quieras cambiar a "otro" o fusionar. Más bien, querrás mantener los niveles más frecuentes y agrupar el resto como "other". Esto es especialmente útil para mostrar tus datos cuando hay muchos niveles y la mayoría son poco frecuentes. Vamos a probarlo con la pregunta de la encuesta de Kaggle sobre qué métodos de machine learning la gente quería probar el próximo año. multiple_choice_responses ya está cargado para ti. Cuando cuentes, recuerda que sort = TRUE corresponde por defecto al orden descendente.

Este ejercicio forma parte del curso

Datos categóricos en el Tidyverse

Ver curso

Instrucciones del ejercicio

  • Elimina a las personas que no seleccionaron ningún método.
  • Crea una nueva variable, ml_method, a partir de MLMethodNextYearSelect que conserve los títulos que tengan al menos el 5% de las respuestas y agrupe el resto como "Other" (el valor predeterminado).
  • Por último, cuenta tu nueva variable, ordenada en orden descendente.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

multiple_choice_responses %>%
  # Remove NAs of MLMethodNextYearSelect
  filter(___) %>%
  # Create ml_method, which lumps all those with less than 5% of people into "Other"
  mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
  # Count the frequency of your new variable, sorted in descending order
  ___(___, ___)
Editar y ejecutar código