Utilizarea Spark în Python
Primul pas în utilizarea Spark este conectarea la un cluster.
În practică, clusterul este găzduit pe o mașină la distanță, conectată la toate celelalte noduri. Există un calculator, numit master, care gestionează împărțirea datelor și a calculelor. Masterul este conectat la restul calculatoarelor din cluster, numite worker. Masterul trimite workerilor date și calcule de executat, iar aceștia trimit rezultatele înapoi la master.
Când abia începi să lucrezi cu Spark, este mai simplu să rulezi un cluster local. Prin urmare, în acest curs, în loc să te conectezi la un alt calculator, toate calculele vor fi rulate pe serverele DataCamp într-un cluster simulat.
Crearea conexiunii este la fel de simplă ca și crearea unei instanțe a clasei SparkContext. Constructorul clasei acceptă câțiva argumente opționale care îți permit să specifici atributele clusterului la care te conectezi.
Un obiect care conține toate aceste atribute poate fi creat cu constructorul SparkConf(). Aruncă o privire la documentație pentru toate detaliile!
Pe parcursul acestui curs, vei avea deja disponibil în spațiul de lucru un SparkContext numit sc.
Cum te conectezi la un cluster Spark din PySpark?
Acest exercițiu face parte din cursul
Fundamente PySpark
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul