ПочатиПочніть безкоштовно

Перевірка кешу в Spark UI

Доступний датафрейм partitioned_df. Його використано для реєстрації тимчасової таблиці text. Потім text кешується за допомогою spark.catalog.cacheTable('text'). Якщо б ви запускали Spark локально, Spark UI був би доступний за адресою http://localhost:4040/storage/. Для цієї вправи розгляньте зображення нижче. Воно показує, що відобразить Spark UI після завантаження кешу для text:

Spark UI Storage

На ньому видно, що таблиця text із сімома розділами (partitions) кешована в пам'яті. Що з наведеного нижче негайно призведе до появи цього вікна в Spark UI?

  1. Виконання трансформації над базовим датафреймом, наприклад: df = partitioned_df.distinct().

  2. Підрахунок рядків у базовому датафреймі, наприклад: partitioned_df.count()

  3. Виконання запиту до таблиці, наприклад: spark.sql("select count(*) from text")

  4. Виконання запиту та виведення результату, наприклад: spark.sql("select count(*) from text").show()

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу