कॉलम्स का सारांश निकालना
पिछले अभ्यास में आपने जो mutate() फंक्शन देखा, वह कॉलम्स को इनपुट लेता है और एक कॉलम लौटाता है। अगर आप mean, maximum, या standard deviation जैसी summary statistics निकाल रहे हैं, तो आमतौर पर आप कॉलम्स को इनपुट लेते हैं लेकिन एक सिंगल वैल्यू लौटाना चाहते हैं। यह summarize() फंक्शन से किया जाता है।
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
ध्यान दें कि dplyr की एक सोच है (जो sparklyr में भी आती है) कि डेटा को हमेशा tibbles में रखा जाए। इसलिए यहाँ रिटर्न वैल्यू एक tibble है जिसमें एक पंक्ति होती है, और जितनी summary statistics निकाली गई हैं, उतने कॉलम होते हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बना दिया गया है। Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है।
titleऔरdurationफ़ील्ड चुनें।- इसके परिणाम को pipe करके एक नया फ़ील्ड
duration_minutesबनाएँ, जिसमें ट्रैक की अवधि मिनटों में हो। - इसके परिणाम को pipe करके
summarize()में दें ताकि मिनटों में औसत अवधिmean_duration_minutesनाम के फ़ील्ड में निकले।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___