शुरू करेंमुफ़्त में शुरू करें

वेक्टर डेटा के लिए UDF बनाना

एक dataframe df उपलब्ध है, जिसमें vector टाइप का output कॉलम है. इसकी पहली पाँच पंक्तियाँ कंसोल में दिखाई गई हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • first_udf नाम का एक UDF बनाएँ. यह किसी वेक्टर कॉलम का पहला एलिमेंट चुनता है. ऐसे किसी आइटम के लिए जो कम से कम एक आइटम वाले वेक्टर के रूप में नहीं है, परिणाम का डिफॉल्ट मान 0.0 रखें और आउटपुट को float में कास्ट करें.
  • df पर select ऑपरेशन का उपयोग करके output कॉलम पर first_udf लगाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
कोड संपादित करें और चलाएँ