or
Toto cvičení je součástí kurzu
Seznámíš se s pojmem redukce dimenzionality a dozvíš se, kdy a proč je důležitá. Pochopíš rozdíl mezi výběrem příznaků a jejich extrakcí a obě techniky si vyzkoušíš při průzkumu dat. Kapitola završí lekce o t-SNE – výkonné technice extrakce příznaků, která ti umožní vizualizovat vícerozměrný dataset.
Aktuální cvičení
V první ze dvou kapitol věnovaných výběru příznaků se dozvíš o prokletí dimenzionality a o tom, jak ti redukce dimenzionality pomůže ho překonat. Seznámíš se s řadou technik pro odhalení a odstranění příznaků, které datasetu přinášejí jen malou přidanou hodnotu – ať už proto, že mají nízkou varianci, příliš mnoho chybějících hodnot, nebo proto, že silně korelují s jinými příznaky.
Ve druhé kapitole o výběru příznaků se naučíš, jak využít modely k nalezení nejdůležitějších příznaků v datasetu pro předpověď konkrétního cílového příznaku. V závěrečné lekci této kapitoly zkombinuješ doporučení více různých modelů a rozhodneš se, které příznaky stojí za zachování.
Tato kapitola se podrobně zaměřuje na nejpoužívanější algoritmus redukce dimenzionality – analýzu hlavních komponent (PCA). Pochopíš intuici za tím, jak a proč je tento algoritmus tak výkonný, a použiješ ho jak při průzkumu dat, tak při jejich předzpracování v modelovacím pipeline. Kapitolu zakončíš praktickým příkladem komprese obrázků.