Spark से डेटा वापस इकट्ठा करना
Chapter 1 के 'Exploring the structure of tibbles' अभ्यास में आपने देखा था कि tibbles डेटा की कॉपी स्टोर नहीं करते. डेटा Spark में ही रहता है, और tibble बस यह विवरण रखता है कि उसे Spark से क्या प्राप्त करना है.
ऐसी कई स्थितियाँ हैं जब आप अपना डेटा Spark से R में लाना चाहेंगे. आपने देखा है कि जब आप प्रिंट करते हैं तो कुछ डेटा Spark से R में आ जाता है. अगर आप प्लॉट बनाना चाहते हैं, या कोई ऐसा मॉडलिंग तकनीक इस्तेमाल करना चाहते हैं जो Spark में उपलब्ध नहीं है, तो भी आपको डेटासेट collect करना होगा. (आखिरकार, R में किसी भी प्रोग्रामिंग भाषा की तुलना में सबसे व्यापक मॉडल्स उपलब्ध हैं.)
अपना डेटा इकट्ठा करने के लिए — यानी उसे Spark से R में लाने के लिए — आप collect() कॉल करते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble track_metadata_tbl के रूप में पहले से परिभाषित है.
track_metadata_tblकी वे पंक्तियाँ फ़िल्टर करें जहाँartist_familiarity0.9 से अधिक है, और नतीजेresultsमें असाइन करें.resultsकी class प्रिंट करें, ध्यान दें कि यहtbl_lazyहै (remote डेटा के लिए इस्तेमाल होता है).- अपने नतीजों को collect करें, उन्हें
collectedमें असाइन करें. collectedकी class प्रिंट करें, ध्यान दें कि यहtbl_dfहै (local डेटा के लिए इस्तेमाल होता है).
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___