शुरू करेंमुफ़्त में शुरू करें

Flights डेटा लोड करना

इस अभ्यास में आप एक CSV फ़ाइल से एयरलाइन फ्लाइट डेटा लोड करेंगे। अभ्यास जल्दी चले, इसके लिए इन डेटा को घटाकर केवल 50,000 रिकॉर्ड्स तक रखा गया है। उसी फ़ॉर्मैट में बड़ा डेटासेट आपको यहाँ मिल सकता है.

CSV फ़ॉर्मैट पर नोट्स:

  • फ़ील्ड्स को कॉमा से अलग किया गया है (यह डिफ़ॉल्ट सेपरेटर है) और
  • missing डेटा को 'NA' स्ट्रिंग से दर्शाया गया है.

डेटा डिक्शनरी:

  • mon — महीना (1 से 12 के बीच का integer)
  • dom — महीने का दिन (1 से 31 के बीच का integer)
  • dow — सप्ताह का दिन (integer; 1 = Monday और 7 = Sunday)
  • carrier — कैरियर (IATA code)
  • flight — फ़्लाइट नंबर
  • org — ओरिजिन एयरपोर्ट (IATA code)
  • mile — दूरी (miles)
  • depart — डिपार्चर समय (decimal hour)
  • duration — अपेक्षित अवधि (minutes)
  • delay — देरी (minutes)

pyspark आपके लिए import किया गया है और सेशन initialize कर दिया गया है.

नोट: डेटा को काफ़ी आक्रामक तरीके से down-sample किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • flights.csv नाम की CSV फ़ाइल से डेटा पढ़िए। कॉलम के डेटा टाइप्स अपने-आप असाइन होने दें। missing डेटा को ठीक से हैंडल कीजिए.
  • डेटा में कुल कितने रिकॉर्ड्स हैं?
  • पहले पाँच रिकॉर्ड्स देखिए.
  • कॉलम्स को कौन-से डेटा टाइप्स असाइन हुए हैं? क्या वे सही लगते हैं?

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
कोड संपादित करें और चलाएँ