CommencezCommencez gratuitement

Validation des données chargées dans une base de données Postgres

Dans cet exercice, vous allez enfin créer un pipeline de données de bout en bout. Ce pipeline extraira les résultats de tests scolaires à partir d'un fichier JSON et transformera les données pour supprimer les lignes contenant des notes manquantes. En plus de cela, chaque école sera classée par ville où elle se trouve, selon son total des points. Enfin, l'ensemble de données transformé sera stocké dans une base de données Postgres.

Pour vous donner un coup de pouce, les fonctions extract() et transform() ont été créées et utilisées comme ci-dessous. De plus, pandas a été importé sous le nom pd. Bonne réussite!

# Extraire et nettoyer les résultats de tests.
raw_testing_scores = extract("testing_scores.json")
cleaned_testing_scores = transform(raw_testing_scores)

Cette activité fait partie du cours

ETL et ELT en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

def load(clean_data, con_engine):
	# Store the data in the schools database
    clean_data.____(
    	name="scores_by_city",
		con=con_engine,
		____="____",  # Make sure to replace existing data
		index=True,
		index_label="school_id"
    )
Modifier et exécuter le code