एक schema परिभाषित करना
डिफ़ाइंड schema बनाना डेटा क्वालिटी और इम्पोर्ट परफॉर्मेंस में मदद करता है. लेसन में बताए अनुसार, हम निम्न कॉलम पढ़ने के लिए एक सिंपल schema बनाएँगे:
- Name
- Age
- City
Name और City कॉलम StringType() हैं और Age कॉलम IntegerType() है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
pyspark.sql.typesलाइब्रेरी से*को इम्पोर्ट करें.StructTypeमेथड का उपयोग करके एक नया schema परिभाषित करें.name,age, औरcityके लिएStructFieldपरिभाषित करें. हर फ़ील्ड का datatype सही हो औरnullableन हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the pyspark.sql.types library
____
# Define a new schema using the StructType method
people_schema = ____([
# Define a StructField for each field
StructField('name', ____, False),
____('____', IntegerType(), ____)
____
])