Aan de slagBegin gratis

Voor elkaar gemaakt

Met R kun je snel code voor data-analyse schrijven. Met een beetje aandacht maak je je code ook goed leesbaar, waardoor je die makkelijk kunt onderhouden. In veel gevallen is R ook snel genoeg om je code uit te voeren.

Helaas vereist R dat alle data in het geheugen (RAM) op één machine past. Dat beperkt hoeveel data je met R kunt analyseren. Er zijn enkele oplossingen voor dit probleem, waaronder het gebruik van Spark.

Spark is een open-source platform voor cluster computing. Dat betekent dat je je data en berekeningen over meerdere machines kunt verdelen, zodat je in feite een onbeperkte hoeveelheid data kunt analyseren. De twee technologieën vullen elkaar perfect aan. Door R en Spark samen te gebruiken, kun je code snel schrijven én snel uitvoeren!

sparklyr is een R-package waarmee je R-code kunt schrijven om met data in een Spark-cluster te werken. Het heeft een dplyr-interface, wat betekent dat je (min of meer) dezelfde dplyr-achtige R-code kunt schrijven, of je nu met data op je eigen machine werkt of op een Spark-cluster.

Schreeuw als je sneller wilt!

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Interactieve oefening met praktijkervaring

Zet theorie om in actie met een van onze interactieve oefeningen

Begin oefening