शुरू करेंमुफ़्त में शुरू करें

प्रति इमेज काउंट

इस डेटासेट के लिए डेटा पाइपलाइन बनाते समय आपका अगला कार्य कुछ analysis-उन्मुख कॉलम बनाना है. आपसे dog_list कॉलम (जो आपने पहले बनाया था) के आधार पर प्रत्येक इमेज में पाए गए कुत्तों की संख्या निकालने को कहा गया है. आपने DogType भी बनाया है, जो कुछ डेटा कॉलमों के भीतर डेटा को बेहतर तरीके से parse करने में मदद करेगा.

joined_df आपके द्वारा अंतिम बार परिभाषित रूप में उपलब्ध है, और DogType StructType परिभाषित है. pyspark.sql.functions F उपनाम के रूप में उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • dog_list की प्रत्येक एंट्री को उसके उपयुक्त हिस्सों में बाँटने के लिए एक Python फ़ंक्शन बनाएँ. सुनिश्चित करें कि किसी भी string को उपयुक्त types में कन्वर्ट करें, वरना DogType सही से parse नहीं करेगा.
  • ऊपर दिए गए फ़ंक्शन का उपयोग करके एक UDF बनाएँ.
  • UDF का उपयोग करके dogs नाम का नया कॉलम बनाएँ.
  • नई कॉलम में कुत्तों की संख्या पहली 10 पंक्तियों के लिए दिखाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create a function to return the number and type of dogs as a tuple
def dogParse(doglist):
  dogs = []
  for dog in doglist:
    (breed, start_x, start_y, end_x, end_y) = dog.____('____')
    dogs.append((____, int(____), ____, ____, ____))
  return dogs

# Create a UDF
udfDogParse = ____(____, ArrayType(____))

# Use the UDF to list of dogs
joined_df = joined_df.____('____', ____('____'))

# Show the number of dogs in the first 10 rows
joined_df.____(____('____')).____(____)
कोड संपादित करें और चलाएँ