वेक्टर डेटा के लिए UDF बनाना
एक dataframe df उपलब्ध है, जिसमें vector टाइप का output कॉलम है. इसकी पहली पाँच पंक्तियाँ कंसोल में दिखाई गई हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spark SQL परिचय
अभ्यास निर्देश
first_udfनाम का एक UDF बनाएँ. यह किसी वेक्टर कॉलम का पहला एलिमेंट चुनता है. ऐसे किसी आइटम के लिए जो कम से कम एक आइटम वाले वेक्टर के रूप में नहीं है, परिणाम का डिफॉल्ट मान 0.0 रखें और आउटपुट को float में कास्ट करें.dfपरselectऑपरेशन का उपयोग करकेoutputकॉलम परfirst_udfलगाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)