or
Toto cvičení je součástí kurzu
Spark je framework pro práci s velkými daty. V této kapitole získáš přehled o Sparku a strojovém učení. Pak zjistíš, jak se ke Sparku připojit pomocí Pythonu a jak načíst data ve formátu CSV.
Teď, když umíš dostat data do Sparku, se pustíš do tvorby dvou typů klasifikačních modelů: rozhodovacích stromů a logistické regrese. Zároveň se seznámíš s několika přístupy k přípravě dat.
Dále se naučíš vytvářet modely lineární regrese. Zjistíš také, jak obohatit svá data vytvářením nových prediktorů a jak spolehlivě vybrat jen ty nejrelevantnější z nich.
Aktuální cvičení
V závěrečné kapitole se naučíš, jak zefektivnit své modely. Zjistíš, jak používat pipeline, aby byl tvůj kód přehlednější a snáze udržovatelný. Pak využiješ křížovou validaci k lepšímu testování modelů a výběru vhodných parametrů. Nakonec si vyzkoušíš dva typy ensemble modelů.