ÎncepețiÎncepe gratuit

Pipeline-uri de Machine Learning

În următoarele două capitole vei parcurge fiecare etapă a unui pipeline de machine learning, de la preluarea datelor până la evaluarea modelului. Să începem!

În centrul modulului pyspark.ml se află clasele Transformer și Estimator. Aproape toate celelalte clase din modul se comportă similar cu aceste două clase de bază.

Clasele de tip Transformer dispun de o metodă .transform() care primește un DataFrame și returnează un DataFrame nou – de obicei cel original, cu o coloană nouă adăugată. De exemplu, poți folosi clasa Bucketizer pentru a crea intervale discrete dintr-o caracteristică continuă sau clasa PCA pentru a reduce dimensionalitatea setului de date prin analiză în componente principale.

Clasele de tip Estimator implementează toate o metodă .fit(). Aceste metode primesc și ele un DataFrame, însă în loc să returneze un alt DataFrame, returnează un obiect model. Acesta poate fi, de exemplu, un StringIndexerModel pentru includerea datelor categorice salvate ca șiruri de caractere în modelele tale, sau un RandomForestModel care folosește algoritmul random forest pentru clasificare sau regresie.

Care dintre afirmațiile de mai jos nu este adevărată despre machine learning în Spark?

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul