การอ่านไฟล์ CSV และการทำ Aggregation
คุณมีสเปรดชีตข้อมูลเงินเดือนของนักวิทยาศาสตร์ข้อมูลจากบริษัทหลายขนาด ตั้งแต่ขนาดเล็กไปจนถึงขนาดใหญ่ และต้องการดูว่าเงินเดือนเฉลี่ยแตกต่างกันอย่างมีนัยสำคัญหรือไม่เมื่อจัดกลุ่มตามขนาดของบริษัท
อย่าลืมว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่แล้วใน Workspace ของคุณ!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- โหลดไฟล์ CSV เป็น DataFrame พร้อมกำหนดให้อนุมาน Schema โดยอัตโนมัติ
- คืนค่าจำนวนแถวทั้งหมด
- จัดกลุ่มตามคอลัมน์
company_sizeและคำนวณเงินเดือนเฉลี่ยโดยใช้salary_in_usd
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()