Spojování tabulek
Tabulky v relačních databázích mají zpravidla klíčové sloupce s jedinečnými identifikátory záznamů. Díky tomu můžeme budovat pipelines, které tabulky kombinují pomocí SQL operace JOIN, místo abychom data spojovali až po jejich importu.
Záznamy v tabulce hpd311calls se často týkají problémů – jako jsou úniky vody nebo výpadky topení – které se zhoršují vlivem počasí. V tomto cvičení připojíš data o počasí (weather) k záznamům volání přes jejich společné sloupce s datem, aby ses dostal/a ke všem informacím v jednom dataframu. Můžeš předpokládat, že tyto sloupce mají stejný datový typ.
pandas je načten jako pd a databázový engine engine už byl vytvořen.
Poznámka: SQL checker je v otázce pořadí tabulek při joinu přísný – očekává konkrétní tabulky na levé a pravé straně.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Doplň dotaz tak, aby spojil
weathershpd311callspřes jejich sloupcedateacreated_date. - Dotazuj databázi a výsledný dataframe ulož do proměnné
calls_with_weather. - Vypiš prvních několik řádků
calls_with_weathera ověř, že byly připojeny všechny sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Query to join weather to call records by date columns
query = """
SELECT *
FROM hpd311calls
JOIN ____
ON hpd311calls.____ = ____.____;
"""
# Create dataframe of joined tables
calls_with_weather = ____
# View the dataframe to make sure all columns were joined
____