Kom igångKom igång gratis

Skapade för varandra

R låter dig skriva dataanalykod snabbt. Med lite omsorg kan du också göra koden lättläst, vilket innebär att den är enkel att underhålla. I många fall är R dessutom tillräckligt snabbt för att köra koden.

Tyvärr kräver R att all data analyseras i minnet (RAM) på en enda maskin. Det begränsar hur mycket data du kan analysera med R. Det finns några lösningar på det här problemet – en av dem är Spark.

Spark är en plattform för klusterdatorer med öppen källkod. Det innebär att du kan sprida dina data och beräkningar över flera maskiner, vilket i praktiken låter dig analysera obegränsade mängder data. De två teknikerna kompletterar varandra väldigt bra. Genom att använda R och Spark tillsammans kan du skriva kod snabbt och köra kod snabbt!

sparklyr är ett R-paket som låter dig skriva R-kod för att arbeta med data i ett Spark-kluster. Det har ett dplyr-gränssnitt, vilket innebär att du kan skriva (mer eller mindre) samma dplyr-stil R-kod oavsett om du arbetar med data på din egen maskin eller i ett Spark-kluster.

Skrik om du vill gå snabbare!

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen