यूनिक पंक्तियाँ चुनना
यदि आपके पास किसी फैक्टर में संग्रहीत एक कैटिगोरिकल वैरिएबल है, तो यह जानना उपयोगी होता है कि उसकी व्यक्तिगत कैटेगरीज़ क्या हैं; इसके लिए आप levels() फंक्शन का उपयोग करते हैं। एक tibble के लिए, अधिक सामान्य कार्य यह है कि यूनिक डेटा वाली पंक्तियाँ ढूँढी जाएँ। SQL की शब्दावली के अनुसार, यह distinct() फंक्शन से किया जाता है। आप इसे सीधे अपने डेटासेट पर चला सकते हैं, ताकि किसी विशेष कॉलम-समूह के यूनिक कॉम्बिनेशन मिल सकें। उदाहरण के लिए, x, y, और z कॉलमों में मानों के यूनिक कॉम्बिनेशन ढूँढने के लिए आप निम्न लिखेंगे।
a_tibble %>%
distinct(x, y, z)
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बना दिया गया है। Spark में संग्रहीत ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है।
track_metadata_tblसेartist_nameकॉलम के distinct मान खोजें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___