Spark, Hadoop và Hive
Trong video trước, bạn đã gặp khá nhiều dự án nguồn mở: Hadoop, Hive và PySpark. Rất dễ nhầm lẫn giữa các dự án này.
Chúng có một vài điểm chung: tất cả đều đang được Apache Software Foundation duy trì và đều từng được dùng cho xử lý song song ở quy mô lớn. Bạn có thể chỉ ra sự khác biệt không?
Bài tập này là một phần của khóa học
Introduction to Data Engineering
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập