CommencezCommencez gratuitement

Gérer des données fortement imbriquées

Au dernier exercice, vous avez aplati des données imbriquées d'un niveau. Ici, vous allez déplier des données encore plus imbriquées.

L'attribut categories dans la réponse de l'API Yelp contient des listes d'objets. Pour aplatir ces données, vous utiliserez les arguments de json_normalize() pour indiquer le chemin vers categories et choisir d'autres attributs à inclure dans le dataframe. Vous devez aussi changer le séparateur pour faciliter la sélection des colonnes et ajouter un préfixe aux autres attributs pour éviter les conflits de noms de colonnes. Nous allons procéder étape par étape.

pandas (sous pd) et json_normalize() ont été importés. Des données Yelp en format JSON sur les cafés à New York sont stockées dans data.

Cette activité fait partie du cours

Ingestion de données rationalisée avec pandas

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Flatten businesses records and set underscore separators
flat_cafes = ____(data["businesses"],
                  ____)

# View the data
print(flat_cafes.head())
Modifier et exécuter le code