Dog parsing
आपने शुरुआती डेटासेट पर काफी क्लीनअप कर लिया है, लेकिन अब डेटा का थोड़ा गहराई से विश्लेषण करना है। अब कुछ सवाल उठे हैं कि किसी इमेज में किस प्रकार के कुत्ते दिख रहे हैं और इमेज से जुड़े कुछ विवरण क्या हैं। आपको एहसास होता है कि इन सवालों के जवाब देने के लिए, आपको डेटा को एक विशेष टाइप में प्रोसेस करना होगा। उसे इस्तेमाल करने से पहले, आपको कुत्ते के विवरण को दर्शाने के लिए एक schema/टाइप बनाना होगा.
joined_df DataFrame वही है जैसा आपने पिछली बार परिभाषित किया था, और pyspark.sql.types पहले से इम्पोर्ट किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
- DataFrame से कुत्ते के विवरण दर्शाने वाले कॉलम को सेलेक्ट करें और पहले 10 बिना ट्रंकेट किए हुए rows दिखाएँ.
- जैसा आपने पहले किया है, वैसा ही एक नया schema बनाएँ, जिसमें नाम breed, start_x, start_y, end_x, और end_y हों। सुनिश्चित करें कि schema में हर फ़ील्ड के लिए सही डेटा टाइप निर्दिष्ट करें (कोई भी संख्यात्मक मान integer है)।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])