or
Ця вправа є частиною курсу
У цьому розділі ви познайомитеся з захопливим світом Big Data, а також із ключовими поняттями та різними фреймворками для її обробки. Ви зрозумієте, чому Apache Spark вважають найкращим фреймворком для Big Data.
Головна абстракція, яку надає Spark, — це стійкий розподілений набір даних (RDD), що є базовим і опорним типом даних цього рушія. У цьому розділі представлено RDD і показано, як створювати та виконувати RDD за допомогою перетворень (Transformations) і дій (Actions) над RDD.
У цьому розділі ви дізнаєтеся про Spark SQL — модуль Spark для обробки структурованих даних. Він надає програмну абстракцію під назвою DataFrame і також може працювати як розподілений рушій SQL-запитів. Розділ показує, як Spark SQL дає змогу використовувати DataFrame у Python.
PySpark MLlib — це масштабовна бібліотека машинного навчання Apache Spark для Python, що містить поширені алгоритми навчання та утиліти. Упродовж цього завершального розділу ви опануєте важливі алгоритми машинного навчання. Ви створите рушій рекомендацій фільмів і фільтр спаму та застосуєте кластеризацію k-means.
Поточна вправа