Spark डेटा टाइप्स की पड़ताल
आपने पहले ही (अध्याय 1 में) src_tbls() देखा है, जो उन DataFrames की सूची देता है जिन्हें sparklyr Spark पर देख सकता है. आपने glimpse() भी देखा है, जो R साइड पर किसी tibble के कॉलम्स को एक्सप्लोर करने में मदद करता है.
sparklyr में sdf_schema() नाम का एक फंक्शन है, जो R साइड पर किसी tibble के कॉलम्स की जानकारी देखने के काम आता है. इसे कॉल करना आसान है; लेकिन इसके रिटर्न वैल्यू के साथ काम करना थोड़ा झंझट वाला हो सकता है.
sdf_schema(a_tibble)
रिटर्न वैल्यू एक लिस्ट होती है, और उसका हर एलिमेंट दो घटकों वाली एक लिस्ट होता है, जिसमें हर कॉलम का नाम और उसका डेटा टाइप होता है. इस अभ्यास में डेटा टाइप्स को और पढ़ने-योग्य रूप में देखने के लिए एक डेटा ट्रांसफ़ॉर्मेशन दिखाया गया है.
यहाँ R डेटा टाइप्स और Spark डेटा टाइप्स का मैपिंग दिया गया है. अन्य डेटा टाइप्स फिलहाल sparklyr द्वारा सपोर्ट नहीं किए जाते.
| R type | Spark type |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है.
- ट्रैक मेटाडेटा की स्कीमा पाने के लिए
sdf_schema()कॉल करें. schemaपर ट्रांसफ़ॉर्मेशन कोड चलाएँ ताकि आप इसे अधिक पढ़ने-योग्य tibble फ़ॉर्मेट में देख सकें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()