or
Bài tập này là một phần của khóa học
Chương này giới thiệu thế giới Big Data đầy hứng khởi, cùng các khái niệm và những khung xử lý Big Data khác nhau. Bạn sẽ hiểu vì sao Apache Spark được xem là khung tốt nhất cho Big Data.
Trừu tượng chính mà Spark cung cấp là resilient distributed dataset (RDD), kiểu dữ liệu nền tảng và xương sống của động cơ này. Chương này giới thiệu về RDD và cách tạo, thực thi RDD thông qua các phép biến đổi (Transformations) và hành động (Actions) trên RDD.
Trong chương này, bạn sẽ học về Spark SQL, một mô-đun của Spark dành cho xử lý dữ liệu có cấu trúc. Nó cung cấp một lớp trừu tượng lập trình gọi là DataFrame và cũng có thể hoạt động như một engine truy vấn SQL phân tán. Chương này cho thấy cách Spark SQL cho phép bạn sử dụng DataFrame trong Python.
PySpark MLlib là thư viện Machine Learning có khả năng mở rộng của Apache Spark trong Python, bao gồm các thuật toán học máy phổ biến và các tiện ích kèm theo. Xuyên suốt chương cuối, bạn sẽ học các thuật toán Machine Learning quan trọng. Bạn sẽ xây dựng hệ gợi ý phim và bộ lọc thư rác, và sử dụng phân cụm k-means.
Bài tập hiện tại