Co je vlastně Spark?
Spark je platforma pro clusterové výpočty. Umožňuje ti rozložit data i výpočty napříč clustery složenými z více uzlů (každý uzel si představ jako samostatný počítač). Díky rozdělení dat je práce s velmi velkými datovými sadami mnohem snazší – každý uzel totiž zpracovává jen malou část celku.
Protože každý uzel pracuje se svou vlastní podmnožinou dat, zároveň provádí část celkových výpočtů. Zpracování dat i samotné výpočty tak probíhají paralelně napříč uzly clusteru. A právě paralelní výpočty dokážou určité typy programovacích úloh výrazně zrychlit.
S větším výpočetním výkonem ale přichází i větší složitost.
Rozhodnout, jestli je Spark pro tvůj problém tím správným nástrojem, chce trochu zkušeností. Pomoci ti mohou například tyto otázky:
- Jsou moje data příliš velká na to, aby se dala zpracovat na jednom počítači?
- Dají se moje výpočty snadno paralelizovat?
Těšíš se, až se o Sparku dozvíš víc?
Toto cvičení je součástí kurzu
Foundations of PySpark
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení