ÎncepețiÎncepe gratuit

Obținerea valorilor distincte

Uneori, o analiză nu necesită toate înregistrările, ci doar valorile unice dintr-una sau mai multe coloane. Valorile duplicate pot fi eliminate după încărcarea datelor într-un dataframe, dar acest lucru se poate face și la import, folosind cuvântul cheie DISTINCT din SQL.

Deoarece hpd311calls conține date despre probleme locative, ne așteptăm ca majoritatea înregistrărilor să aibă un cartier (borough) specificat. Să testăm această ipoteză interogând combinațiile unice de complaint_type și borough.

pandas a fost importat ca pd, iar motorul bazei de date a fost creat ca engine.

Notă: Verificatorul SQL este destul de strict în privința ordinii coloanelor și se așteaptă ca câmpurile să fie selectate în ordinea specificată.

Acest exercițiu face parte din cursul

Ingestie eficientă a datelor cu pandas

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o interogare care obține valorile DISTINCT pentru borough și complaint_type (în această ordine) din hpd311calls.
  • Folosește read_sql() pentru a încărca rezultatele interogării într-un dataframe numit issues_and_boros.
  • Afișează dataframe-ul pentru a verifica dacă ipoteza că toate problemele, cu excepția solicitărilor de materiale informative, apar cu boroughs specificate este confirmată.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Editează și rulează codul