เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การอ่านไฟล์ CSV และการทำ Aggregation

คุณมีสเปรดชีตข้อมูลเงินเดือนของนักวิทยาศาสตร์ข้อมูลจากบริษัทหลายขนาด ตั้งแต่ขนาดเล็กไปจนถึงขนาดใหญ่ และต้องการดูว่าเงินเดือนเฉลี่ยแตกต่างกันอย่างมีนัยสำคัญหรือไม่เมื่อจัดกลุ่มตามขนาดของบริษัท

อย่าลืมว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่แล้วใน Workspace ของคุณ!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดไฟล์ CSV เป็น DataFrame พร้อมกำหนดให้อนุมาน Schema โดยอัตโนมัติ
  • คืนค่าจำนวนแถวทั้งหมด
  • จัดกลุ่มตามคอลัมน์ company_size และคำนวณเงินเดือนเฉลี่ยโดยใช้ salary_in_usd

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
แก้ไขและรันโค้ด