ПочатиПочніть безкоштовно

Практикуємо логування 2

Під час запуску виконується такий код:

import logging
logging.basicConfig(stream=sys.stdout, level=logging.DEBUG,
                    format='%(levelname)s - %(message)s')

У уроці ми дізналися, що операції Spark, які запускають дію, потрібно логувати обережно, щоб уникнути непомітної втрати обчислювальних ресурсів. Тепер ви потренуєтеся визначати оператори логування, які запускають дію над датафреймом або таблицею.

Доступний датафрейм text_df. Цей датафрейм зареєстровано як таблицю з назвою table1.

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Подано кілька операторів логування. Усі вони спочатку закоментовані. Розкоментуйте п'ять операторів, які не запускають дію над text_df.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Uncomment the 5 statements that do NOT trigger text_df
# logging.debug("text_df columns: %s", text_df.columns)
# logging.info("table1 is cached: %s", spark.catalog.isCached(tableName="table1"))
# logging.warning("The first row of text_df: %s", text_df.first())
# logging.error("Selected columns: %s", text_df.select("id", "word"))
# logging.info("Tables: %s", spark.sql("show tables").collect())
# logging.debug("First row: %s", spark.sql("SELECT * FROM table1 limit 1"))
# logging.debug("Count: %s", spark.sql("SELECT COUNT(*) AS count FROM table1").collect())
Редагувати та запускати код