Созданы друг для друга
R позволяет быстро писать код для анализа данных. При должном внимании к структуре код получается понятным и простым в поддержке. Во многих случаях R также достаточно быстро выполняет вычисления.
Однако у R есть ограничение: все данные должны помещаться в оперативную память одной машины. Это сдерживает объём данных, с которыми можно работать. Существует несколько способов решить эту проблему — один из них Spark.
Spark — это платформа с открытым исходным кодом для распределённых вычислений. Она позволяет распределять данные и вычисления между несколькими машинами, что фактически снимает ограничения на объём анализируемых данных. Эти две технологии отлично дополняют друг друга: используя R и Spark вместе, вы можете писать код быстро и выполнять его быстро!
sparklyr — это пакет R, который позволяет писать R-код для работы с данными в кластере Spark. Он предоставляет интерфейс dplyr, а значит, вы можете писать код в стиле dplyr практически одинаково — независимо от того, работаете ли вы с данными на своей машине или в кластере Spark.
Кричите, если хотите ускориться!
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение