शुरू करेंमुफ़्त में शुरू करें

डेटा टाइप्स

शानदार काम! मॉडलिंग शुरू करने से पहले यह जानना ज़रूरी है कि Spark सिर्फ़ संख्यात्मक डेटा संभालता है. इसका मतलब है कि आपके DataFrame की सभी कॉलम्स या तो integers होनी चाहिएँ या decimals (Spark में इन्हें 'doubles' कहा जाता है).

जब हमने अपना डेटा इम्पोर्ट किया, तो हमने Spark को यह अनुमान लगाने दिया कि हर कॉलम में किस तरह की जानकारी है. दुर्भाग्य से, Spark हमेशा सही अनुमान नहीं लगाता और आप देख सकते हैं कि हमारे DataFrame की कुछ कॉलम्स वास्तविक संख्यात्मक वैल्यूज़ के बजाय numbers वाले strings हैं.

इसे ठीक करने के लिए, आप .cast() मेथड को .withColumn() मेथड के साथ मिलाकर उपयोग कर सकते हैं. ध्यान दें कि .cast() कॉलम्स पर काम करता है, जबकि .withColumn() DataFrames पर काम करता है.

.cast() को आपको सिर्फ़ एक आर्ग्युमेंट देना होता है—जिस टाइप की वैल्यू आप बनाना चाहते हैं, उसे string के रूप में. उदाहरण के लिए, integers बनाने के लिए आप "integer" पास करेंगे और decimal numbers के लिए "double" इस्तेमाल करेंगे.

आप .withColumn() के अंदर .cast() कॉल रखकर पहले से मौजूद कॉलम को ओवरराइट भी कर सकते हैं, जैसा आपने पिछले चैप्टर में किया था!

मॉडलिंग के लिए Spark को किस तरह का डेटा चाहिए?

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें