Začněte nyníZačněte zdarma

Pipelines pro strojové učení

V následujících dvou kapitolách projdeš celým procesem pipeline pro strojové učení – od načtení dat až po vyhodnocení modelu. Tak se do toho pusťme!

Jádrem modulu pyspark.ml jsou třídy Transformer a Estimator. Téměř každá další třída v tomto modulu se chová podobně jako tyto dva základní typy.

Třídy Transformer mají metodu .transform(), která přijme DataFrame a vrátí nový DataFrame – obvykle ten původní s přidaným sloupcem. Můžeš například použít třídu Bucketizer pro rozdělení spojité proměnné do diskrétních košů nebo třídu PCA pro snížení dimenzionality datasetu pomocí analýzy hlavních komponent.

Třídy Estimator implementují metodu .fit(). Tyto metody také přijímají DataFrame, ale místo toho, aby vrátily další DataFrame, vrátí objekt modelu. Může to být například StringIndexerModel pro zahrnutí kategorických dat uložených jako řetězce do tvých modelů, nebo RandomForestModel, který využívá algoritmus náhodného lesa pro klasifikaci nebo regresi.

Které z následujících tvrzení o strojovém učení ve Sparku není pravdivé?

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení