Zacznij terazZacznij za darmo

Wykorzystanie mikro-partycji i klastrowania danych

Podczas krótkiej rozmowy na korytarzu twoja Lead Data Engineer wspomniała, że Snowflake używa klastrowania danych do sortowania rekordów w mikro-partycjach według pola year w tabeli olympic_medals. Masz kilka zapytań, które regularnie wykonujesz na tej tabeli – chcesz je zaktualizować, aby lepiej wykorzystać mechanizm mikro-partycji i klastrowania danych w Snowflake.

Funkcja create_engine z modułu sqlalchemy została już zaimportowana, a obiekt połączenia jest dostępny w zmiennej conn.

To ćwiczenie jest częścią kursu

Wprowadzenie do NoSQL

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaktualizuj zapytanie Snowflake tak, aby zwracało tylko rekordy dotyczące igrzysk, które odbyły się w roku 2000 lub później.
  • Zwróć wyniki zapytania Snowflake jako DataFrame biblioteki pandas i wydrukuj otrzymany zbiór wyników.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Leverage the existing micro-partitions and data clustering
query = """
SELECT
	team,
    year,
    sport,
    event,
    medal
FROM olympic_medals
____ year >= ____;
"""

# Execute the query, print the results
results = conn.cursor().____(query).fetch_pandas_all()
print(____)
Edytuj i uruchom kod