Ověření dat načtených do databáze Postgres
V tomto cvičení sestavíš datový pipeline od začátku do konce. Pipeline extrahuje výsledky školních testů z JSON souboru a transformuje data tak, aby odstranil řádky s chybějícími hodnotami. Každá škola bude navíc seřazena podle města, ve kterém se nachází, na základě celkového skóre. Nakonec se transformovaná data uloží do databáze Postgres.
Aby ses rychleji rozběhl/a, funkce extract() a transform() jsou již připravené a použité, jak je vidět níže. Také pandas je importovaný jako pd. Hodně zdaru!
# Extrahuj a vyčisti výsledky testů.
raw_testing_scores = extract("testing_scores.json")
cleaned_testing_scores = transform(raw_testing_scores)
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def load(clean_data, con_engine):
# Store the data in the schools database
clean_data.____(
name="scores_by_city",
con=con_engine,
____="____", # Make sure to replace existing data
index=True,
index_label="school_id"
)