CSV पढ़ना और एग्रीगेशन करना
आपके पास Data Scientist सैलरीज़ की एक स्प्रेडशीट है, जिसमें कंपनियों का आकार छोटा से बड़ा तक है। आप देखना चाहते हैं कि कंपनी के आकार के अनुसार समूहित औसत सैलरी में कोई बड़ा अंतर है या नहीं.
ध्यान रखें, आपके वर्कस्पेस में पहले से SparkSession नाम का spark मौजूद है!
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark परिचय
अभ्यास निर्देश
- किसी CSV फ़ाइल को DataFrame के रूप में लोड करें और schema को infer करें.
- पंक्तियों की कुल संख्या लौटाएँ.
- कॉलम
company_sizeके आधार पर group करें औरsalary_in_usdके साथ average salary गणना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()