Obținerea valorilor distincte
Uneori, o analiză nu necesită toate înregistrările, ci doar valorile unice dintr-una sau mai multe coloane. Valorile duplicate pot fi eliminate după încărcarea datelor într-un dataframe, dar acest lucru se poate face și la import, folosind cuvântul cheie DISTINCT din SQL.
Deoarece hpd311calls conține date despre probleme locative, ne așteptăm ca majoritatea înregistrărilor să aibă un cartier (borough) specificat. Să testăm această ipoteză interogând combinațiile unice de complaint_type și borough.
pandas a fost importat ca pd, iar motorul bazei de date a fost creat ca engine.
Notă: Verificatorul SQL este destul de strict în privința ordinii coloanelor și se așteaptă ca câmpurile să fie selectate în ordinea specificată.
Acest exercițiu face parte din cursul
Ingestie eficientă a datelor cu pandas
Instrucțiuni pentru exercițiu
- Creează o interogare care obține valorile
DISTINCTpentruboroughșicomplaint_type(în această ordine) dinhpd311calls. - Folosește
read_sql()pentru a încărca rezultatele interogării într-un dataframe numitissues_and_boros. - Afișează dataframe-ul pentru a verifica dacă ipoteza că toate problemele, cu excepția solicitărilor de materiale informative, apar cu boroughs specificate este confirmată.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)