Luyện tập cache: tổng hợp mọi thứ
Cách tiếp cận tốt nhất để cache df1 và df2 là gì và vì sao?
Kết quả của bạn có thể khác; dưới đây là một kết quả (ngẫu nhiên) cho mỗi trong hai cách tiếp cận:
Đáp án đầu tiên (cache df1):
df1_1st : 2.4s
df1_2nd : 0.1s
df2_1st : 0.3s
df2_2nd : 0.2s
Overall elapsed : 3.9
Đáp án thứ hai (cache df2):
df1_1st : 2.3s
df1_2nd : 1.1s
df2_1st : 1.7s
df2_2nd : 0.1s
Overall elapsed : 6.4
Bài tập này là một phần của khóa học
Nhập môn Spark SQL bằng Python
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập