Začněte nyníZačněte zdarma

Stvořeni jeden pro druhého

R ti umožňuje psát kód pro datovou analýzu rychle a přehledně. S trochou péče ho zvládneš udržet čitelný, a tím pádem i snadno spravovatelný. V mnoha případech je R také dostatečně rychlý při samotném spouštění kódu.

Nevýhodou R je, že veškerá data musejí být zpracována v paměti (RAM) na jednom počítači. To výrazně omezuje množství dat, se kterými můžeš pracovat. Existuje několik řešení tohoto problému – jedním z nich je Spark.

Spark je open source platforma pro clusterové výpočty. To znamená, že můžeš rozdělit data i výpočty napříč více stroji, a tím efektivně analyzovat prakticky neomezené množství dat. Obě technologie se skvěle doplňují. R a Spark společně ti umožní psát kód rychle a zároveň ho rychle spouštět!

sparklyr je R balíček, který ti dovoluje psát R kód pro práci s daty ve Spark clusteru. Nabízí rozhraní dplyr, takže můžeš psát (víceméně) stejný R kód ve stylu dplyr bez ohledu na to, jestli pracuješ s daty na svém počítači, nebo ve Spark clusteru.

Křič, pokud chceš jet rychleji!

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení