Bắt đầu ngayBắt đầu miễn phí

Thu thập RDDs

Trong bài tập này, bạn sẽ làm việc với cả RDD và DataFrame trong PySpark. Mục tiêu là nhóm dữ liệu và thực hiện phép tổng hợp bằng cả thao tác trên RDD và phương thức của DataFrame.

Bạn sẽ tải một tệp CSV chứa dữ liệu lương nhân viên vào PySpark dưới dạng RDD. Sau đó, bạn sẽ nhóm theo mức độ kinh nghiệm và tính mức lương tối đa cho mỗi mức độ kinh nghiệm từ một DataFrame. Bằng cách này, bạn sẽ thấy điểm mạnh tương đối của cả hai định dạng dữ liệu.

Bộ dữ liệu bạn dùng liên quan đến Data Scientist Salaries, nên việc tìm xu hướng thị trường sẽ rất có ích cho bạn! Chúng tôi đã tải và chuẩn hóa dữ liệu sẵn cho bạn! Hãy nhớ rằng đã có một SparkSession tên là spark trong môi trường làm việc của bạn!

Bài tập này là một phần của khóa học

Nhập môn PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo một RDD từ một DataFrame.
  • Thu thập và hiển thị kết quả của RDD và DataFrame.
  • Nhóm theo "experience_level" và tính mức lương tối đa cho từng nhóm.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Chỉnh sửa và Chạy Mã