or
Acest exercițiu face parte din cursul
Acest capitol îți prezintă lumea fascinantă a Big Data, precum și diversele concepte și framework-uri utilizate pentru procesarea datelor de mari dimensiuni. Vei înțelege de ce Apache Spark este considerat cel mai bun framework pentru Big Data.
Principala abstractizare oferită de Spark este setul de date distribuit și rezistent (RDD), tipul de date fundamental al acestui motor. Acest capitol îți prezintă RDD-urile și arată cum pot fi create și executate prin Transformări și Acțiuni RDD.
În acest capitol, vei învăța despre Spark SQL, un modul Spark pentru procesarea datelor structurate. Acesta oferă o abstractizare de programare numită DataFrame și poate funcționa și ca motor distribuit de interogări SQL. Capitolul îți arată cum Spark SQL îți permite să lucrezi cu DataFrame-uri în Python.
PySpark MLlib este biblioteca scalabilă de învățare automată Apache Spark în Python, care conține algoritmi de învățare și utilitare uzuale. Pe parcursul acestui ultim capitol, vei învăța algoritmi importanți de Machine Learning. Vei construi un motor de recomandare de filme și un filtru anti-spam și vei aplica clustering k-means.
Exercițiul curent