कॉलम्स को बदलना (Mutating)
यह जानकर आपको हैरानी हो सकती है कि हर डेटासेट शुरू से पूरी तरह साफ नहीं होता! अक्सर आपको मान ठीक करने होते हैं, या अपने मौजूदा डेटा से नए कॉलम बनाने होते हैं। कॉलम बदलने या जोड़ने की प्रक्रिया को dplyr शब्दावली में mutation कहा जाता है, और यह mutate() से की जाती है। यह फंक्शन एक tibble लेता है, और कॉलम अपडेट करने के लिए नामित आर्ग्युमेंट्स लेता है। हर आर्ग्युमेंट का नाम उस कॉलम का नाम होता है जिसे बदलना या जोड़ना है, और उसका मान यह व्यक्त करता है कि उसे कैसे अपडेट करना है। उदाहरण के लिए, अगर किसी tibble में x और y कॉलम हैं, तो नीचे का कोड x को अपडेट करेगा और एक नया कॉलम z बनाएगा।
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
अगर अब तक यह संदेश साफ नहीं हुआ कि base-R फंक्शंस Spark tibbles के साथ काम नहीं करते, तो जान लें कि इस काम के लिए आप within() या transform() का उपयोग नहीं कर सकते.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है। Spark में स्टोर किए गए ट्रैक मेटाडेटा से जुड़ा एक tibble track_metadata_tbl के रूप में पहले से परिभाषित है।
titleऔरdurationफ़ील्ड्स चुनें। ध्यान दें कि durations सेकंड्स में हैं।- इसके परिणाम को पाइप करके
mutate()में भेजें ताकिduration_minutesनाम का नया फ़ील्ड बने, जिसमें ट्रैक की अवधि मिनट्स में हो।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___