Використання Spark у Python
Перший крок у роботі зі Spark — під'єднання до кластера.
На практиці кластер зазвичай розміщено на віддаленій машині, під'єднаній до всіх інших вузлів. Є один комп'ютер — «master», який керує розподілом даних і обчислень. Master з'єднаний з рештою комп'ютерів у кластері, які називаються «worker». Master надсилає worker-ам дані та обчислення для виконання, а вони повертають результати назад master-у.
Коли ви лише знайомитеся зі Spark, простіше запустити кластер локально. Тому в цьому курсі, замість під'єднання до іншого комп'ютера, усі обчислення виконуватимуться на серверах DataCamp у змодельованому кластері.
Створити з'єднання так само просто, як створити екземпляр класу SparkContext. Конструктор класу приймає кілька необов'язкових аргументів, які дають змогу вказати атрибути кластера, до якого ви під'єднуєтеся.
Об'єкт, що містить усі ці атрибути, можна створити конструктором SparkConf(). Перегляньте документацію для всіх подробиць!
Упродовж цього курсу у вашому робочому середовищі вже буде доступний SparkContext з іменем sc.
Як під'єднатися до кластера Spark з PySpark?
Ця вправа є частиною курсу
Основи PySpark
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу