Stworzeni dla siebie
R pozwala pisać kod do analizy danych szybko i czytelnie – a czytelny kod jest też łatwy w utrzymaniu. W wielu przypadkach R radzi sobie równie dobrze z samym wykonywaniem kodu.
Niestety, R wymaga, by wszystkie dane były przetwarzane w pamięci operacyjnej (RAM) na jednej maszynie. To ogranicza ilość danych, które możesz analizować. Istnieje kilka rozwiązań tego problemu – jednym z nich jest Spark.
Spark to platforma obliczeniowa open source przeznaczona dla klastrów. Dzięki niej możesz rozłożyć dane i obliczenia na wiele maszyn, co w praktyce pozwala analizować nieograniczone ilości danych. Te dwie technologie doskonale się uzupełniają – R i Spark razem umożliwiają pisanie kodu szybko i jego szybkie wykonywanie!
sparklyr to pakiet R, który pozwala pisać kod R do pracy z danymi w klastrze Spark. Oferuje interfejs dplyr, co oznacza, że możesz pisać kod w stylu dplyr niemal tak samo, niezależnie od tego, czy pracujesz z danymi lokalnie, czy w klastrze Spark.
Krzycz, jeśli chcesz jechać szybciej!
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie