Sprawdzanie bufora w Spark UI
Dostępna jest ramka danych partitioned_df. Służy ona do zarejestrowania tymczasowej tabeli o nazwie text. Tabela text jest następnie buforowana za pomocą spark.catalog.cacheTable('text'). Gdybyś uruchamiał(-a) Sparka lokalnie, Spark UI byłby dostępny pod adresem http://localhost:4040/storage/. Na potrzeby tego ćwiczenia przyjrzyj się poniższemu obrazowi. Pokazuje on, co wyświetliłby Spark UI po załadowaniu bufora dla tabeli text:

Widać, że tabela text składająca się z siedmiu partycji jest buforowana w pamięci. Która z poniższych operacji spowodowałaby natychmiastowe pojawienie się tego widoku w Spark UI?
Wykonanie transformacji na źródłowej ramce danych, np.
df = partitioned_df.distinct().Zliczenie wierszy źródłowej ramki danych, np.:
partitioned_df.count()Zapytanie do tabeli, np.:
spark.sql("select count(*) from text")Zapytanie do tabeli i wyświetlenie wyniku, np.:
spark.sql("select count(*) from text").show()
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie