CommencerCommencez gratuitement

Jouer avec des tweets, manche 1

Vous vous souvenez que, dans les chapitres précédents, vous travailliez comme data analyst pour une agence web ? Eh bien, votre travail a porté ses fruits et l’on vous confie un nouveau projet ;) Dans ce chapitre, vous allez analyser un nouveau type de données : une sortie JSON.

Votre équipe d’ingénierie vous a fourni la sortie d’une collecte de données contenant des tweets rassemblés pendant la RStudio Conf 2018. Comme cet ensemble de données est en JSON, vous l’avez lu en R sous forme de liste imbriquée.

Pour commencer, vous souhaitez explorer rapidement cet ensemble de données, et purrr va vous y aider. Le package a été chargé pour vous, et le jeu de données rstudioconf est disponible dans votre espace de travail.

Remarque : n’essayez pas d’afficher l’ensemble complet — il est trop volumineux pour la console DataCamp.

Attention : il s’agit de vraies données issues de Twitter ; il existe donc un risque de présence de grossièretés ou d’autres contenus offensants (dans cet exercice et dans tout exercice ultérieur utilisant de vraies données Twitter).

Cet exercice fait partie du cours

<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>
Voir le cours

Instructions de l’exercice

  • Affichez le premier élément de la liste pour avoir un aperçu du contenu et de la structure.

  • Comme vous souhaitez vous concentrer sur les tweets originaux (et non les retweets), créez une sous-liste de non‑retweets à l’aide de l’élément logique "is_retweet" présent dans chaque sous-liste.

  • Extrayez l’élément "favorite_count" de chaque élément de cette nouvelle sous-liste en utilisant la variante map_* adaptée aux entiers.

  • Calculez la médiane du résultat précédent.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Print the first element of the list to the console 


# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")

# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")

# Get the median of favorite_count for non_rt
___(___)
Modifier et exécuter le code