Pipeline-uri de Machine Learning
În următoarele două capitole vei parcurge fiecare etapă a unui pipeline de machine learning, de la preluarea datelor până la evaluarea modelului. Să începem!
În centrul modulului pyspark.ml se află clasele Transformer și Estimator. Aproape toate celelalte clase din modul se comportă similar cu aceste două clase de bază.
Clasele de tip Transformer dispun de o metodă .transform() care primește un DataFrame și returnează un DataFrame nou – de obicei cel original, cu o coloană nouă adăugată. De exemplu, poți folosi clasa Bucketizer pentru a crea intervale discrete dintr-o caracteristică continuă sau clasa PCA pentru a reduce dimensionalitatea setului de date prin analiză în componente principale.
Clasele de tip Estimator implementează toate o metodă .fit(). Aceste metode primesc și ele un DataFrame, însă în loc să returneze un alt DataFrame, returnează un obiect model. Acesta poate fi, de exemplu, un StringIndexerModel pentru includerea datelor categorice salvate ca șiruri de caractere în modelele tale, sau un RandomForestModel care folosește algoritmul random forest pentru clasificare sau regresie.
Care dintre afirmațiile de mai jos nu este adevărată despre machine learning în Spark?
Acest exercițiu face parte din cursul
Fundamente PySpark
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul