Sử dụng xử lý lười (lazy processing)
Các phép xử lý lười thường trả về trong khoảng thời gian gần như nhau, bất kể lượng dữ liệu thực tế. Hãy nhớ rằng điều này là do Spark không thực hiện bất kỳ phép biến đổi nào cho đến khi có một hành động được yêu cầu.
Trong bài này, bạn sẽ định nghĩa một Data Frame (aa_dfw_df) và thêm một vài phép biến đổi. Lưu ý lượng thời gian cần để hoàn tất các phép biến đổi khi chỉ mới được định nghĩa so với khi dữ liệu thực sự được truy vấn. Sự chênh lệch có thể ngắn, nhưng bạn sẽ nhận ra. Khi làm việc với cả cụm Spark và khối lượng dữ liệu lớn hơn, khác biệt sẽ rõ hơn.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Tải Data Frame.
- Thêm phép biến đổi
F.lower()cho cộtDestination Airport. - Hiển thị Data Frame và lưu ý sự khác biệt về thời gian để hành động này hoàn tất.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____