शुरू करेंमुफ़्त में शुरू करें

Common people

distinct() फंक्शन ने आपको यूनिक मान दिखाए थे. यह जानना भी उपयोगी है कि प्रत्येक मान के आपके पास कितने रिकॉर्ड हैं. बेस R का फंक्शन table() इसके लिए है; यह sparklyr में समर्थित नहीं है क्योंकि यह tidyverse के उस सिद्धांत से मेल नहीं खाता जिसमें सब कुछ tibbles में रहता है. इसकी जगह, आपको count() इस्तेमाल करना होता है. इसे इस्तेमाल करने के लिए, कॉलम के अनक्वोटेड नाम पास करें. उदाहरण के लिए, कॉलम x, y, और z के अलग-अलग संयोजनों की गिनती निकालने के लिए आप यह टाइप करेंगे:

a_tibble %>%
  count(x, y, z)

परिणाम इस के समान होगा:

a_tibble %>%
  distinct(x, y, z)

… सिवाय इसके कि आपको एक अतिरिक्त कॉलम n मिलता है जिसमें काउंट्स होते हैं.

count() का एक बढ़िया उपयोग है किसी चीज़ के सबसे सामान्य मान निकालना. इसके लिए, आप count() को sort = TRUE आर्ग्युमेंट के साथ कॉल करते हैं, जो पंक्तियों को n कॉलम के अवरोही मानों के हिसाब से सॉर्ट करता है, फिर शीर्ष जितने भी मान चाहिए, उतने तक सीमित करने के लिए slice_max() का उपयोग करते हैं. (slice_max() बेस R के head() जैसा है, लेकिन यह Spark जैसे remote डेटासेट्स के साथ काम करता है.) उदाहरण के लिए, x, y, और z कॉलम्स के सबसे सामान्य शीर्ष 20 संयोजन पाने के लिए निम्नलिखित चलाएँ:

a_tibble %>%
  count(x, y, z, sort = TRUE) %>%
  slice_max(20)

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn नाम का Spark कनेक्शन बनाया गया है. Spark में संग्रहीत ट्रैक मेटाडेटा से जुड़ा एक tibble पहले से track_metadata_tbl के रूप में परिभाषित है.

  • track_metadata_tbl से artist_name कॉलम के मानों की गिनती करें.
    • पंक्तियों को अवरोही लोकप्रियता के अनुसार सॉर्ट करने के लिए sort = TRUE पास करें.
  • परिणामों को शीर्ष 20 तक सीमित करने के लिए slice_max() का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Count the artist_name values
  ___ %>%
  # Restrict to top 20
  ___
कोड संपादित करें और चलाएँ