ÎncepețiÎncepe gratuit

Selectarea coloanelor cu SQL

Seturile de date pot conține coloane care nu sunt necesare pentru o analiză – cum este cazul tabelului weather din data.db. Unele coloane sunt redundante, de exemplu elevația, deoarece toate observațiile au fost înregistrate în același loc; altele conțin variabile care nu ne interesează. După ce creezi un motor de bază de date, vei scrie o interogare care SELECTează doar coloanele cu data și temperatura, apoi le vei transmite funcției read_sql() pentru a obține un dataframe cu valorile maxime și minime de temperatură.

pandas a fost importat ca pd, iar create_engine() a fost importat din sqlalchemy.

Notă: Verificatorul SQL este destul de strict în privința ordinii coloanelor și se așteaptă ca câmpurile să fie selectate în ordinea specificată.

Acest exercițiu face parte din cursul

Ingestie eficientă a datelor cu pandas

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un motor de bază de date pentru data.db.
  • Scrie o interogare SQL care SELECTează coloanele date, tmax și tmin din tabelul weather.
  • Creează un dataframe transmițând interogarea și motorul funcției read_sql(), apoi atribuie dataframe-ul rezultat variabilei temperatures.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create database engine for data.db
engine = ____

# Write query to get date, tmax, and tmin from weather
query = """
SELECT ____, 
       ____, 
       ____
  FROM ____;
"""

# Make a dataframe by passing query and engine to read_sql()
temperatures = ____

# View the resulting dataframe
print(temperatures)
Editează și rulează codul