शुरू करेंमुफ़्त में शुरू करें

Spark डेटा टाइप्स की पड़ताल

आपने पहले ही (अध्याय 1 में) src_tbls() देखा है, जो उन DataFrames की सूची देता है जिन्हें sparklyr Spark पर देख सकता है. आपने glimpse() भी देखा है, जो R साइड पर किसी tibble के कॉलम्स को एक्सप्लोर करने में मदद करता है.

sparklyr में sdf_schema() नाम का एक फंक्शन है, जो R साइड पर किसी tibble के कॉलम्स की जानकारी देखने के काम आता है. इसे कॉल करना आसान है; लेकिन इसके रिटर्न वैल्यू के साथ काम करना थोड़ा झंझट वाला हो सकता है.

sdf_schema(a_tibble)

रिटर्न वैल्यू एक लिस्ट होती है, और उसका हर एलिमेंट दो घटकों वाली एक लिस्ट होता है, जिसमें हर कॉलम का नाम और उसका डेटा टाइप होता है. इस अभ्यास में डेटा टाइप्स को और पढ़ने-योग्य रूप में देखने के लिए एक डेटा ट्रांसफ़ॉर्मेशन दिखाया गया है.

यहाँ R डेटा टाइप्स और Spark डेटा टाइप्स का मैपिंग दिया गया है. अन्य डेटा टाइप्स फिलहाल sparklyr द्वारा सपोर्ट नहीं किए जाते.

R type Spark type
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है.

  • ट्रैक मेटाडेटा की स्कीमा पाने के लिए sdf_schema() कॉल करें.
  • schema पर ट्रांसफ़ॉर्मेशन कोड चलाएँ ताकि आप इसे अधिक पढ़ने-योग्य tibble फ़ॉर्मेट में देख सकें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
कोड संपादित करें और चलाएँ