or
Den här övningen är en del av kursen
Spark är ett ramverk för att arbeta med Big Data. I det här kapitlet får du en bakgrund till Spark och maskininlärning. Du lär dig sedan hur du ansluter till Spark med Python och läser in CSV-data.
Nu när du är bekant med att läsa in data i Spark går vi vidare till att bygga två typer av klassificeringsmodeller: beslutsträd och logistisk regression. Du lär dig också om några metoder för dataförberedelse.
Härnäst lär du dig att skapa linjära regressionsmodeller. Du får också se hur du utökar din data genom att konstruera nya prediktorer samt hur du väljer ut enbart de mest relevanta prediktorer på ett robust sätt.
Aktuell övning
Slutligen lär du dig att göra dina modeller mer effektiva. Du ser hur du använder pipelines för att göra koden tydligare och lättare att underhålla. Sedan använder du korsvalidering för att testa dina modeller bättre och välja lämpliga modellparametrar. Avslutningsvis provar du på två typer av ensemblemodeller.