Validarea datelor încărcate într-o bază de date Postgres
În acest exercițiu, vei construi un pipeline de date de la capăt la capăt. Acest pipeline va extrage scorurile testelor școlare dintr-un fișier JSON și va transforma datele pentru a elimina rândurile cu scoruri lipsă. În plus, fiecare școală va fi clasată în funcție de orașul în care se află, pe baza scorurilor totale. În final, setul de date transformat va fi stocat într-o bază de date Postgres.
Pentru a-ți ușura munca, funcțiile extract() și transform() au fost deja implementate și utilizate după cum se arată mai jos. De asemenea, pandas a fost importat ca pd. Mult succes!
# Extract and clean the testing scores.
raw_testing_scores = extract("testing_scores.json")
cleaned_testing_scores = transform(raw_testing_scores)
Acest exercițiu face parte din cursul
ETL și ELT în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def load(clean_data, con_engine):
# Store the data in the schools database
clean_data.____(
name="scores_by_city",
con=con_engine,
____="____", # Make sure to replace existing data
index=True,
index_label="school_id"
)