Maskininlärningspipelines
I de kommande två kapitlen går du igenom varje steg i maskininlärningspipelinen – från datainläsning till modellutvärdering. Nu kör vi!
Kärnan i modulen pyspark.ml utgörs av klasserna Transformer och Estimator. Nästan alla andra klasser i modulen fungerar på liknande sätt som dessa två grundklasser.
Klasser av typen Transformer har en .transform()-metod som tar en DataFrame och returnerar en ny DataFrame – vanligtvis den ursprungliga med en ny kolumn tillagd. Du kan till exempel använda klassen Bucketizer för att skapa diskreta intervall från ett kontinuerligt särdrag, eller klassen PCA för att minska dimensionaliteten i din datamängd med hjälp av principalkomponentanalys.
Klasser av typen Estimator implementerar alla en .fit()-metod. Dessa metoder tar också en DataFrame, men istället för att returnera en ny DataFrame returnerar de ett modellobjekt. Det kan till exempel vara en StringIndexerModel för att inkludera kategoriska data lagrade som strängar i dina modeller, eller en RandomForestModel som använder algoritmen random forest för klassificering eller regression.
Vilket av följande påståenden stämmer inte om maskininlärning i Spark?
Den här övningen är en del av kursen
Grunderna i PySpark
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen