Začněte nyníZačněte zdarma

Získání unikátních hodnot

Někdy analýza nevyžaduje všechny záznamy, ale pouze unikátní hodnoty v jednom nebo více sloupcích. Duplicitní hodnoty lze odstranit po načtení dat do dataframe, ale dá se to vyřešit i přímo při importu pomocí klíčového slova DISTINCT v SQL.

Protože hpd311calls obsahuje data o problémech s bydlením, očekáváme, že u většiny záznamů bude uvedena čtvrť (borough). Ověřme tento předpoklad dotazem na unikátní kombinace complaint_type a borough.

pandas je importován jako pd a databázový engine je dostupný jako engine.

Poznámka: SQL kontroler je poměrně přísný ohledně pořadí sloupců a očekává, že pole budou vybrána v uvedeném pořadí.

Toto cvičení je součástí kurzu

Streamlined Data Ingestion with pandas

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř dotaz, který z tabulky hpd311calls načte hodnoty DISTINCT pro borough a complaint_type (v tomto pořadí).
  • Pomocí read_sql() načti výsledky dotazu do dataframe issues_and_boros.
  • Vypiš dataframe a ověř, zda platí předpoklad, že všechny problémy kromě žádostí o literaturu mají uvedenou čtvrť.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Upravit a spustit kód