Brincando com tweets, rodada 1
Lembra que, nos capítulos anteriores, você estava trabalhando como analista de dados em uma agência web? Pois é, você mandou muito bem e agora ganhou mais um projeto ;) Neste capítulo, você vai analisar um novo tipo de dado: saída em JSON.
Sua equipe de engenharia forneceu a saída de uma coleta de dados contendo tweets, reunidos durante a RStudio Conf 2018. Como esse conjunto de dados está em JSON, você o leu como uma lista aninhada no R.
Para começar, você quer fazer uma exploração básica desse conjunto de dados, e o purrr vai te ajudar nisso. O pacote já foi carregado para você, e o conjunto rstudioconf está disponível no seu ambiente de trabalho.
Atenção: não tente imprimir o conjunto inteiro — ele é grande demais para ser exibido no console do DataCamp.
Fique ciente de que estes são dados reais do Twitter e, como tal, há sempre o risco de conterem palavrões ou outro conteúdo ofensivo (neste exercício e em quaisquer exercícios seguintes que também usem dados reais do Twitter).
Este exercicio faz parte do curso
Programação Funcional Intermediária com purrr
Instruções do exercicio
Imprima o primeiro elemento da lista para ter uma visão geral do conteúdo e da estrutura.
Como você quer focar em tweets originais (não retweets), crie uma sublista sem retweets usando o elemento lógico
"is_retweet"presente em cada sublista.Extraia o elemento
"favorite_count"de cada elemento dessa nova sublista usando a variantemap_*para inteiros.Calcule a mediana do resultado anterior.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)