НачатьНачать бесплатно

Созданы друг для друга

R позволяет быстро писать код для анализа данных. При должном внимании к структуре код получается понятным и простым в поддержке. Во многих случаях R также достаточно быстро выполняет вычисления.

Однако у R есть ограничение: все данные должны помещаться в оперативную память одной машины. Это сдерживает объём данных, с которыми можно работать. Существует несколько способов решить эту проблему — один из них Spark.

Spark — это платформа с открытым исходным кодом для распределённых вычислений. Она позволяет распределять данные и вычисления между несколькими машинами, что фактически снимает ограничения на объём анализируемых данных. Эти две технологии отлично дополняют друг друга: используя R и Spark вместе, вы можете писать код быстро и выполнять его быстро!

sparklyr — это пакет R, который позволяет писать R-код для работы с данными в кластере Spark. Он предоставляет интерфейс dplyr, а значит, вы можете писать код в стиле dplyr практически одинаково — независимо от того, работаете ли вы с данными на своей машине или в кластере Spark.

Кричите, если хотите ускориться!

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение