शुरू करेंमुफ़्त में शुरू करें

Come together

वे फीचर जिन पर आप मॉडल चलाने वाले हैं, timbre डेटासेट में हैं, लेकिन रिस्पॉन्स — यानी year — track_metadata डेटासेट में है. मॉडल चलाने से पहले, आपको इन दोनों डेटासेट्स को आपस में जोड़ना होगा. इस मामले में दोनों डेटासेट्स की पंक्तियाँ एक-से-एक मेल खाती हैं, इसलिए आपको inner join चाहिए.

एक और डेटा क्लीनिंग का काम बाकी है. year कॉलम में integers हैं, लेकिन Spark की modeling फंक्शंस को real numbers चाहिए. आपको year कॉलम को numeric में बदलना होगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए track metadata और timbre डेटा से जुड़े tibbles क्रमशः track_metadata_tbl और timbre_tbl के रूप में पहले से मौजूद हैं.

  • track_id कॉलम के आधार पर track metadata को timbre डेटा के साथ inner join करें.
  • year कॉलम को numeric में कन्वर्ट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl, timbre_tbl pre-defined
track_metadata_tbl
timbre_tbl

track_metadata_tbl %>%
  # Inner join to timbre_tbl
  ___ %>%
  # Convert year to numeric
  ___
कोड संपादित करें और चलाएँ