Kom igångKom igång gratis

Hämta distinkta värden

Ibland behöver en analys inte varje enskild post, utan snarare unika värden i en eller flera kolumner. Dublettvärden kan tas bort efter att data har lästs in i en dataframe, men det kan också göras vid import med SQL-nyckelordet DISTINCT.

Eftersom hpd311calls innehåller data om bostadsproblem förväntar vi oss att de flesta poster har ett stadsdistrikt angivet. Låt oss testa det antagandet genom att hämta unika kombinationer av complaint_type och borough.

pandas har importerats som pd och databasmotorn har skapats som engine.

Obs: SQL-kontrollanten är ganska noggrann med kolumnordningen och förväntar sig att fälten väljs i den angivna ordningen.

Den här övningen är en del av kursen

Effektiv datainläsning med pandas

Visa kurs

Övningsinstruktioner

  • Skapa en fråga som hämtar DISTINCT-värden för borough och complaint_type (i den ordningen) från hpd311calls.
  • Använd read_sql() för att läsa in frågeresultaten i en dataframe som du kallar issues_and_boros.
  • Skriv ut dataframen för att kontrollera om antagandet stämmer – att alla ärenden utom litteraturförfrågningar har ett stadsdistrikt angivet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Redigera och kör kod