Zacznij terazZacznij za darmo

Sprawdzanie bufora w Spark UI

Dostępna jest ramka danych partitioned_df. Służy ona do zarejestrowania tymczasowej tabeli o nazwie text. Tabela text jest następnie buforowana za pomocą spark.catalog.cacheTable('text'). Gdybyś uruchamiał(-a) Sparka lokalnie, Spark UI byłby dostępny pod adresem http://localhost:4040/storage/. Na potrzeby tego ćwiczenia przyjrzyj się poniższemu obrazowi. Pokazuje on, co wyświetliłby Spark UI po załadowaniu bufora dla tabeli text:

Spark UI Storage

Widać, że tabela text składająca się z siedmiu partycji jest buforowana w pamięci. Która z poniższych operacji spowodowałaby natychmiastowe pojawienie się tego widoku w Spark UI?

  1. Wykonanie transformacji na źródłowej ramce danych, np. df = partitioned_df.distinct().

  2. Zliczenie wierszy źródłowej ramki danych, np.: partitioned_df.count()

  3. Zapytanie do tabeli, np.: spark.sql("select count(*) from text")

  4. Zapytanie do tabeli i wyświetlenie wyniku, np.: spark.sql("select count(*) from text").show()

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie