शुरू करेंमुफ़्त में शुरू करें

कॉलम्स का सारांश निकालना

पिछले अभ्यास में आपने जो mutate() फंक्शन देखा, वह कॉलम्स को इनपुट लेता है और एक कॉलम लौटाता है। अगर आप mean, maximum, या standard deviation जैसी summary statistics निकाल रहे हैं, तो आमतौर पर आप कॉलम्स को इनपुट लेते हैं लेकिन एक सिंगल वैल्यू लौटाना चाहते हैं। यह summarize() फंक्शन से किया जाता है।

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

ध्यान दें कि dplyr की एक सोच है (जो sparklyr में भी आती है) कि डेटा को हमेशा tibbles में रखा जाए। इसलिए यहाँ रिटर्न वैल्यू एक tibble है जिसमें एक पंक्ति होती है, और जितनी summary statistics निकाली गई हैं, उतने कॉलम होते हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn नाम से एक Spark कनेक्शन बना दिया गया है। Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है।

  • title और duration फ़ील्ड चुनें।
  • इसके परिणाम को pipe करके एक नया फ़ील्ड duration_minutes बनाएँ, जिसमें ट्रैक की अवधि मिनटों में हो।
  • इसके परिणाम को pipe करके summarize() में दें ताकि मिनटों में औसत अवधि mean_duration_minutes नाम के फ़ील्ड में निकले।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
कोड संपादित करें और चलाएँ