Jugando con tuits, ronda 1
¿Recuerdas que en los capítulos anteriores has estado trabajando como analista de datos en una agencia web? Pues lo has hecho genial y ahora te han asignado otro proyecto ;) En este capítulo, vas a analizar un nuevo tipo de datos: salida en JSON.
Tu equipo de ingeniería te ha entregado la salida de una recolección de datos que contiene tuits recopilados durante la RStudio Conf 2018. Como este conjunto de datos está en JSON, lo has leído en R como una lista anidada.
Primero quieres hacer una exploración básica del conjunto de datos, y purrr te va a salvar la papeleta. El paquete ya está cargado y el conjunto de datos rstudioconf está disponible en tu espacio de trabajo.
Nota: no intentes imprimir el conjunto de datos completo: es demasiado grande para mostrarse en la consola de DataCamp.
Ten en cuenta que estos son datos reales de Twitter y, como tal, siempre existe el riesgo de que contengan lenguaje soez u otro contenido ofensivo (en este ejercicio y en cualquiera posterior que también use datos reales de Twitter).
Este ejercicio forma parte del curso
Programación funcional intermedia con purrr
Instrucciones del ejercicio
Imprime el primer elemento de la lista para tener una visión general del contenido y la estructura.
Como quieres centrarte en tuits originales (no retuits), crea una sublista de no retuits usando el elemento lógico
"is_retweet"presente en cada sublista.Extrae el elemento
"favorite_count"de cada elemento de esta nueva sublista usando la variantemap_*para enteros.Calcula la mediana del resultado anterior.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)