Validera data som laddats till en Postgres-databas
I den här övningen får du bygga en komplett datapipeline från start till slut. Pipelinen extraherar testresultat från skolor ur en JSON-fil och transformerar datan genom att ta bort rader med saknade poäng. Dessutom rangordnas varje skola efter den stad den ligger i, baserat på totalpoäng. Slutligen lagras den transformerade datamängden i en Postgres-databas.
För att ge dig ett försprång har funktionerna extract() och transform() redan byggts och används enligt nedan. Dessutom har pandas importerats som pd. Lycka till!
# Extract and clean the testing scores.
raw_testing_scores = extract("testing_scores.json")
cleaned_testing_scores = transform(raw_testing_scores)
Den här övningen är en del av kursen
ETL och ELT i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def load(clean_data, con_engine):
# Store the data in the schools database
clean_data.____(
name="scores_by_city",
con=con_engine,
____="____", # Make sure to replace existing data
index=True,
index_label="school_id"
)