НачатьНачать бесплатно

Изучение кэша в Spark UI

Доступен датафрейм partitioned_df. Он используется для регистрации временной таблицы с именем text. Затем text кэшируется с помощью spark.catalog.cacheTable('text'). При локальном запуске Spark интерфейс Spark UI доступен по адресу http://localhost:4040/storage/. В рамках этого упражнения рассмотрите изображение ниже. На нём показано, что отображает Spark UI после загрузки кэша для text:

Spark UI Storage

На изображении видно, что таблица text, состоящая из семи разделов, кэширована в памяти. Какой из следующих вариантов немедленно приведёт к появлению этих данных в Spark UI?

  1. Выполнение преобразования над исходным датафреймом, например: df = partitioned_df.distinct().

  2. Подсчёт строк исходного датафрейма, например: partitioned_df.count()

  3. Запрос к таблице, например: spark.sql("select count(*) from text")

  4. Запрос с отображением результата, например: spark.sql("select count(*) from text").show()

Это упражнение является частью курса

Введение в Spark SQL на Python

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение