Come together
वे फीचर जिन पर आप मॉडल चलाने वाले हैं, timbre डेटासेट में हैं, लेकिन रिस्पॉन्स — यानी year — track_metadata डेटासेट में है. मॉडल चलाने से पहले, आपको इन दोनों डेटासेट्स को आपस में जोड़ना होगा. इस मामले में दोनों डेटासेट्स की पंक्तियाँ एक-से-एक मेल खाती हैं, इसलिए आपको inner join चाहिए.
एक और डेटा क्लीनिंग का काम बाकी है. year कॉलम में integers हैं, लेकिन Spark की modeling फंक्शंस को real numbers चाहिए. आपको year कॉलम को numeric में बदलना होगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए track metadata और timbre डेटा से जुड़े tibbles क्रमशः track_metadata_tbl और timbre_tbl के रूप में पहले से मौजूद हैं.
track_idकॉलम के आधार पर track metadata को timbre डेटा के साथ inner join करें.yearकॉलम कोnumericमें कन्वर्ट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl, timbre_tbl pre-defined
track_metadata_tbl
timbre_tbl
track_metadata_tbl %>%
# Inner join to timbre_tbl
___ %>%
# Convert year to numeric
___