Изучение кэша в Spark UI
Доступен датафрейм partitioned_df. Он используется для регистрации временной таблицы с именем text. Затем text кэшируется с помощью spark.catalog.cacheTable('text'). При локальном запуске Spark интерфейс Spark UI доступен по адресу http://localhost:4040/storage/. В рамках этого упражнения рассмотрите изображение ниже. На нём показано, что отображает Spark UI после загрузки кэша для text:

На изображении видно, что таблица text, состоящая из семи разделов, кэширована в памяти. Какой из следующих вариантов немедленно приведёт к появлению этих данных в Spark UI?
Выполнение преобразования над исходным датафреймом, например:
df = partitioned_df.distinct().Подсчёт строк исходного датафрейма, например:
partitioned_df.count()Запрос к таблице, например:
spark.sql("select count(*) from text")Запрос с отображением результата, например:
spark.sql("select count(*) from text").show()
Это упражнение является частью курса
Введение в Spark SQL на Python
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение