or
Toto cvičení je součástí kurzu
V této kapitole se seznámíš s tím, co je to feature engineering a jak ho začít aplikovat na reálná data. Načteš, prozkoumáš a vizualizuješ dataset s výsledky průzkumu, a přitom se dozvíš, jaké datové typy obsahuje a proč mají vliv na to, jak bys měl/a příznaky vytvářet. Pomocí balíčku pandas vytvoříš nové příznaky z kategorických i spojitých sloupců.
Tato kapitola tě uvede do reality neuspořádaných a neúplných dat. Naučíš se, jak odhalit chybějící hodnoty v datech, a prozkoumáš různé přístupy k jejich řešení. Zároveň využiješ techniky práce s řetězci k odstranění nežádoucích znaků z datasetu.
V této kapitole se zaměříš na analýzu rozdělení svých dat a na to, zda může ovlivnit tvůj pipeline strojového učení. Naučíš se pracovat se zešikmenými daty a řešit situace, kdy mohou odlehlé hodnoty negativně ovlivňovat tvou analýzu.
V závěrečné kapitole budeš pracovat s nestrukturovanými textovými daty a poznáš způsoby, jak z textového korpusu vytvářet sloupcové příznaky. Porovnáš, jak různé přístupy ovlivňují množství kontextu extrahovaného z textu, a naučíš se vyvážit potřebu kontextu s tím, aby nevznikalo příliš mnoho příznaků.
Aktuální cvičení