पंक्तियों को फ़िल्टर करना
कॉलम चुनने के अलावा, अपने डेटासेट के महत्वपूर्ण हिस्सों को निकालने का दूसरा तरीका पंक्तियों को फ़िल्टर करना है। यह filter() फंक्शन से किया जाता है। filter() का उपयोग करने के लिए, आप इसे एक tibble और कुछ लॉजिकल कंडीशन्स पास करते हैं। उदाहरण के लिए, केवल वही पंक्तियाँ लौटाने के लिए जहाँ कॉलम x के मान शून्य से बड़े हों और y के मान z के बराबर हों, आप निम्न कोड इस्तेमाल करेंगे:
a_tibble %>%
filter(x > 0, y == z)
अभ्यास शुरू करने से पहले, दो चेतावनियों पर ध्यान दें। पहली, dplyr के filter() फंक्शन को stats पैकेज के filter() फंक्शन से ग़लत मत समझिए। दूसरी, sparklyr आपका dplyr कोड Spark को भेजने से पहले SQL डेटाबेस कोड में बदल देता है। इसका मतलब है कि अभी केवल सीमित प्रकार के फ़िल्टरिंग ऑपरेशन्स समर्थित हैं। उदाहरण के तौर पर, आप रेगुलर एक्सप्रेशन्स के साथ कैरेक्टर पंक्तियों को ऐसे कोड से फ़िल्टर नहीं कर सकते:
a_tibble %>%
filter(grepl("a regex", x))
translate_sql() की हेल्प पेज उपलब्ध फंक्शनैलिटी का वर्णन करती है। आप comparison operators जैसे >, !=, और %in%; arithmetic operators जैसे +, ^, और %%; और logical operators जैसे &, | और ! का उपयोग कर सकते हैं। कई गणितीय फंक्शंस जैसे log(), abs(), round(), और sin() भी समर्थित हैं।
पहले की तरह, square bracket indexing फिलहाल काम नहीं करती।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है। Spark में संग्रहीत ट्रैक मेटाडेटा से जुड़ा एक tibble track_metadata_tbl के रूप में प्री-डिफ़ाइंड है।
- पिछले अभ्यास की तरह,
select()का उपयोग करकेartist_name,release,title, औरyearचुनें। - इसके परिणाम को पाइप करके
filter()में भेजें ताकि 1960s के ट्रैक्स मिलें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
glimpse(track_metadata_tbl)
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Filter rows
___