शुरू करेंमुफ़्त में शुरू करें

भाग 1: CSV फ़ाइल से DataFrame बनाएँ

हर 4 साल में, दुनिया भर के फ़ुटबॉल प्रशंसक "Fifa World Cup" नाम का उत्सव मनाते हैं और इसके साथ कई देशों में बहुत कुछ बदलता हुआ दिखता है. इस 3-भाग के अभ्यास में, आप PySpark SQL का उपयोग करके "FIFA 2018 World Cup Player" डेटासेट पर कुछ exploratory data analysis (EDA) करेंगे, जिसमें DataFrame ऑपरेशंस, SQL क्वेरीज़, और visualization शामिल हैं.

पहले भाग में, आप CSV फ़ॉर्मेट में मौजूद FIFA 2018 World Cup Players डेटासेट (Fifa2018_dataset.csv) को PySpark के dataFrame में लोड करेंगे और बेसिक DataFrame ऑपरेशंस से डेटा को जाँचेंगे.

ध्यान रखें, आपके वर्कस्पेस में SparkSession spark और एक वैरिएबल file_path पहले से मौजूद हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • file_path से (जो Fifa2018_dataset.csv फ़ाइल का path है) एक PySpark DataFrame बनाएँ.
  • DataFrame की schema प्रिंट करें.
  • पहली 10 observations प्रिंट करें.
  • DataFrame में कुल कितनी पंक्तियाँ हैं?

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
कोड संपादित करें और चलाएँ