Spark में डेटा कॉपी करना
Spark का कोई भी वास्तविक काम शुरू करने से पहले, आपको अपना डेटा उसमें ले जाना होता है। sparklyr में कुछ फंक्शन हैं, जैसे spark_read_csv(), जो CSV फ़ाइल को Spark में पढ़ लेते हैं। सामान्य रूप से, R से Spark में डेटा कॉपी कर पाना भी उपयोगी है। यह dplyr के copy_to() फंक्शन से किया जाता है। ध्यान दें: डेटा कॉपी करना मूल रूप से एक धीमी प्रक्रिया है। दरअसल, बड़े डेटासेट के साथ काम करते समय प्रदर्शन बेहतर करने की कई रणनीतियाँ इसी बात पर टिकी होती हैं कि डेटा को एक जगह से दूसरी जगह कॉपी करने से कैसे बचा जाए।
copy_to() दो आर्ग्युमेंट लेता है: एक Spark कनेक्शन (dest), और वह डेटा फ़्रेम (df) जिसे Spark में कॉपी करना है।
जब आप अपना डेटा Spark में कॉपी कर लें, तो आप यह जाँचना चाहेंगे कि यह सच में काम कर गया है। आप src_tbls() का उपयोग करके Spark में स्टोर सभी डेटा फ़्रेम की सूची देख सकते हैं, जो बस एक Spark कनेक्शन आर्ग्युमेंट (x) लेता है।
पूरे कोर्स के दौरान, आप Million Song Dataset से ट्रैक मेटाडेटा का अन्वेषण करेंगे। हालाँकि Spark एक मिलियन से कहीं अधिक रो तक आसानी से स्केल कर सकता है, फिर भी चीजों को सरल और responsive रखने के लिए, आप हज़ार ट्रैक्स का सबसेट उपयोग करेंगे। शब्दावली स्पष्ट करने के लिए: एक track डेटासेट की एक row को दर्शाता है। आपके हज़ार-ट्रैक डेटासेट के लिए, यही song के समान है (हालाँकि पूरे मिलियन-रो डेटासेट में कुछ डुप्लिकेट गाने थे)।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
track_metadata, जिसमें 1,000 ट्रैक्स के लिए गाने का नाम, आर्टिस्ट का नाम और अन्य मेटाडेटा है, आपके वर्कस्पेस में पहले से परिभाषित है।
str()का उपयोग करकेtrack_metadataडेटासेट को जाँचिए।- अपने लोकल Spark क्लस्टर से कनेक्ट कीजिए और कनेक्शन को
spark_connमें स्टोर कीजिए। copy_to()का उपयोग करकेtrack_metadataको Spark क्लस्टर में कॉपी कीजिए।src_tbls()का उपयोग करके देखें कि Spark में कौन से डेटा फ़्रेम उपलब्ध हैं।- Spark से डिस्कनेक्ट कीजिए।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load dplyr
___
# Explore track_metadata structure
___
# Connect to your Spark cluster
spark_conn <- spark_connect("___")
# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)
# List the data frames available in Spark
___(___)
# Disconnect from Spark
spark_disconnect(___)