शुरू करेंमुफ़्त में शुरू करें

कॉलम चुनना

Spark में स्टोर किए गए data frames को manipulate करने का सबसे आसान तरीका dplyr सिंटैक्स का उपयोग करना है। dplyr सिंटैक्स से data frames को manipulate करना Data Manipulation with dplyr और Joining Data with dplyr कोर्स में विस्तार से कवर किया गया है, लेकिन आप अगले डेढ़ अध्याय में सभी ज़रूरी बातें यहीं सीखेंगे।

dplyr में पाँच मुख्य कार्रवाइयाँ होती हैं जो आप किसी data frame पर कर सकते हैं। आप कॉलम चुन सकते हैं, पंक्तियों को फ़िल्टर कर सकते हैं, पंक्तियों के क्रम को बदल सकते हैं, कॉलम बदल या नए कॉलम जोड़ सकते हैं, और summary statistics निकाल सकते हैं।

आइए कॉलम चुनने से शुरू करें। यह select() कॉल करके किया जाता है, जिसमें पहले एक tibble दें, फिर बिना कोट किए उन कॉलमों के नाम लिखें जिन्हें आप रखना चाहते हैं। dplyr फंक्शन्स आमतौर पर magrittr के pipe ऑपरेटर %>% के साथ उपयोग किए जाते हैं। x, y, और z कॉलम चुनने के लिए आप यह लिखेंगे:

a_tibble %>%
  select(x, y, z)

ध्यान दें कि sparklyr में square bracket indexing अभी समर्थित नहीं है। इसलिए आप यह नहीं कर सकते:

a_tibble[, c("x", "y", "z")]

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है। Spark में स्टोर किए ट्रैक मेटाडेटा से जुड़ा एक tibble track_metadata_tbl के रूप में पहले से परिभाषित है।

  • select() का उपयोग करके artist_name, release, title, और year चुनें।
  • यही काम square bracket indexing से करने की कोशिश करें। स्पॉइलर! यह कोड error फेंकता है, इसलिए इसे tryCatch() कॉल में लपेटा गया है।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
कोड संपादित करें और चलाएँ