Kom igångKom igång gratis

Använda Spark i Python

Det första steget när du använder Spark är att ansluta till ett kluster.

I praktiken körs klustret på en fjärrdator som är ansluten till alla övriga noder. En dator, kallad master, ansvarar för att dela upp data och beräkningar. Mastern är ansluten till de övriga datorerna i klustret, som kallas workers. Mastern skickar data och beräkningar till workers, som i sin tur skickar resultaten tillbaka.

När du är ny med Spark är det enklast att köra ett kluster lokalt. I den här kursen ansluter du därför inte till någon extern dator – alla beräkningar körs på DataCamps servrar i ett simulerat kluster.

Att skapa anslutningen är lika enkelt som att skapa en instans av klassen SparkContext. Klasskonstruktorn tar ett antal valfria argument som låter dig ange egenskaperna hos det kluster du ansluter till.

Ett objekt med alla dessa egenskaper kan skapas med konstruktorn SparkConf(). Ta en titt på dokumentationen för mer information!

Under resten av kursen finns redan en SparkContext som heter sc tillgänglig i din arbetsyta.

Hur ansluter du till ett Spark-kluster från PySpark?

Den här övningen är en del av kursen

Grunderna i PySpark

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen