Wykorzystanie mikro-partycji i klastrowania danych
Podczas krótkiej rozmowy na korytarzu twoja Lead Data Engineer wspomniała, że Snowflake używa klastrowania danych do sortowania rekordów w mikro-partycjach według pola year w tabeli olympic_medals. Masz kilka zapytań, które regularnie wykonujesz na tej tabeli – chcesz je zaktualizować, aby lepiej wykorzystać mechanizm mikro-partycji i klastrowania danych w Snowflake.
Funkcja create_engine z modułu sqlalchemy została już zaimportowana, a obiekt połączenia jest dostępny w zmiennej conn.
To ćwiczenie jest częścią kursu
Wprowadzenie do NoSQL
Instrukcje do ćwiczenia
- Zaktualizuj zapytanie Snowflake tak, aby zwracało tylko rekordy dotyczące igrzysk, które odbyły się w roku 2000 lub później.
- Zwróć wyniki zapytania Snowflake jako
DataFramebibliotekipandasi wydrukuj otrzymany zbiór wyników.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Leverage the existing micro-partitions and data clustering
query = """
SELECT
team,
year,
sport,
event,
medal
FROM olympic_medals
____ year >= ____;
"""
# Execute the query, print the results
results = conn.cursor().____(query).fetch_pandas_all()
print(____)