Agrupar variables por proporción
Muchas veces no tendrás niveles concretos que quieras cambiar a "otro" o fusionar. Más bien, querrás mantener los niveles más frecuentes y agrupar el resto como "other". Esto es especialmente útil para mostrar tus datos cuando hay muchos niveles y la mayoría son poco frecuentes. Vamos a probarlo con la pregunta de la encuesta de Kaggle sobre qué métodos de machine learning la gente quería probar el próximo año. multiple_choice_responses ya está cargado para ti. Cuando cuentes, recuerda que sort = TRUE corresponde por defecto al orden descendente.
Este ejercicio forma parte del curso
Datos categóricos en el Tidyverse
Instrucciones del ejercicio
- Elimina a las personas que no seleccionaron ningún método.
- Crea una nueva variable,
ml_method, a partir deMLMethodNextYearSelectque conserve los títulos que tengan al menos el 5% de las respuestas y agrupe el resto como "Other" (el valor predeterminado). - Por último, cuenta tu nueva variable, ordenada en orden descendente.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
multiple_choice_responses %>%
# Remove NAs of MLMethodNextYearSelect
filter(___) %>%
# Create ml_method, which lumps all those with less than 5% of people into "Other"
mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
# Count the frequency of your new variable, sorted in descending order
___(___, ___)