शुरू करेंमुफ़्त में शुरू करें

लॉगिंग का अभ्यास 2

स्टार्टअप पर निम्न कोड चलाया जाता है:

import logging
logging.basicConfig(stream=sys.stdout, level=logging.DEBUG,
                    format='%(levelname)s - %(message)s')

लेसन में आपने सीखा कि जो Spark ऑपरेशंस किसी action को ट्रिगर करते हैं, उन्हें compute resources के चुपचाप नुकसान से बचाने के लिए सावधानी से लॉग करना चाहिए. अब आप ऐसे लॉगिंग स्टेटमेंट पहचानने का अभ्यास करेंगे जो किसी dataframe या table पर action ट्रिगर करते हैं.

एक dataframe text_df उपलब्ध है. यह dataframe table1 नाम की table के रूप में रजिस्टर्ड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • कई log स्टेटमेंट दिए गए हैं. शुरू में सभी कमेंट किए गए हैं. उन पाँच स्टेटमेंट्स की टिप्पणी हटाइए जो text_df पर कोई action ट्रिगर नहीं करते.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Uncomment the 5 statements that do NOT trigger text_df
# logging.debug("text_df columns: %s", text_df.columns)
# logging.info("table1 is cached: %s", spark.catalog.isCached(tableName="table1"))
# logging.warning("The first row of text_df: %s", text_df.first())
# logging.error("Selected columns: %s", text_df.select("id", "word"))
# logging.info("Tables: %s", spark.sql("show tables").collect())
# logging.debug("First row: %s", spark.sql("SELECT * FROM table1 limit 1"))
# logging.debug("Count: %s", spark.sql("SELECT COUNT(*) AS count FROM table1").collect())
कोड संपादित करें और चलाएँ