Selectarea coloanelor cu SQL
Seturile de date pot conține coloane care nu sunt necesare pentru o analiză – cum este cazul tabelului weather din data.db. Unele coloane sunt redundante, de exemplu elevația, deoarece toate observațiile au fost înregistrate în același loc; altele conțin variabile care nu ne interesează. După ce creezi un motor de bază de date, vei scrie o interogare care SELECTează doar coloanele cu data și temperatura, apoi le vei transmite funcției read_sql() pentru a obține un dataframe cu valorile maxime și minime de temperatură.
pandas a fost importat ca pd, iar create_engine() a fost importat din sqlalchemy.
Notă: Verificatorul SQL este destul de strict în privința ordinii coloanelor și se așteaptă ca câmpurile să fie selectate în ordinea specificată.
Acest exercițiu face parte din cursul
Ingestie eficientă a datelor cu pandas
Instrucțiuni pentru exercițiu
- Creează un motor de bază de date pentru
data.db. - Scrie o interogare SQL care
SELECTează coloaneledate,tmaxșitmindin tabelulweather. - Creează un dataframe transmițând interogarea și motorul funcției
read_sql(), apoi atribuie dataframe-ul rezultat variabileitemperatures.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create database engine for data.db
engine = ____
# Write query to get date, tmax, and tmin from weather
query = """
SELECT ____,
____,
____
FROM ____;
"""
# Make a dataframe by passing query and engine to read_sql()
temperatures = ____
# View the resulting dataframe
print(temperatures)