Vad är Spark, egentligen?
Spark är en plattform för klusterdatorer. Med Spark kan du fördela data och beräkningar över kluster med flera noder (tänk på varje nod som en separat dator). Genom att dela upp data blir det enklare att arbeta med mycket stora datamängder, eftersom varje nod bara hanterar en liten del av den totala mängden.
Eftersom varje nod arbetar med sin egen delmängd av den totala datan utför den också en del av de totala beräkningarna. Det innebär att både databehandling och beräkningar sker parallellt över noderarna i klustret. Parallella beräkningar kan göra vissa typer av programmeringsuppgifter betydligt snabbare.
Men med större beräkningskraft följer också större komplexitet.
Att avgöra om Spark är den bästa lösningen för ditt problem kräver viss erfarenhet, men du kan ställa dig frågor som:
- Är min data för stor för att hantera på en enda maskin?
- Kan mina beräkningar enkelt parallelliseras?
Är du redo att lära dig mer om Spark?
Den här övningen är en del av kursen
Grunderna i PySpark
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen