or
Toto cvičení je součástí kurzu
V této kapitole si zopakuješ základy workflow pro učení s učitelem: trénování a ladění modelu, výběr modelu, inženýrství příznaků, jejich výběr a techniky rozdělení dat. Pochopíš, jak na sebe tyto kroky navazují, a zjistíš, jak každý z nich může přispívat k přetrénování — nebo ho naopak omezovat. Přetrénování je přitom jedním z největších nepřátel každého datového vědce. Na konci kapitoly budeš mít pevné základy v učení s učitelem a budeš připraven/a ponořit se do pokročilejšího obsahu v dalších kapitolách.
V předchozí kapitole sis upevnil/a znalosti standardních workflow pro učení s učitelem. V této kapitole se kriticky podíváš na to, jak se do učení s učitelem zapojuje odborná znalost z dané oblasti. Věnovat se budeme výběru správné jednotky analýzy, která může vyžadovat inženýrství příznaků z více datových zdrojů, ne vždy dokonalému procesu popisování příkladů a také definici ztrátové funkce, která zachycuje skutečnou obchodní hodnotu chyb tvého modelu strojového učení.
V předchozí kapitole ses naučil/a různé způsoby, jak zapracovat zpětnou vazbu od odborníků do svého workflow a vyhodnocovat ji v souladu s obchodní hodnotou. Teď je čas procvičit dovednosti potřebné k nasazení modelu do produkce a k tomu, aby si i po čase udržel dobrou výkonnost díky průběžnému vylepšování. Naučíš se také diagnostikovat dataset shift a zmírňovat vliv, který může měnící se prostředí mít na přesnost tvého modelu.
Aktuální cvičení
V předchozích kapitolách sis vybudoval/a pevné základy v učení s učitelem včetně nasazování modelů do produkce, přičemž jsi vždy předpokládal/a, že máš k dispozici popsaný dataset. V této kapitole se pustíš do modelování dat zcela bez popisků nebo jen s jejich malým množstvím. Čeká tě výlet do světa detekce anomálií jako formy učení bez učitele, ale i do učení na základě vzdálenosti, kde místo popisků poslouží představy o podobnosti mezi příklady — a dosáhnout přesnosti srovnatelné s učením s učitelem. Po dokončení této kapitoly budeš s přehledem vědět, jaké nástroje použít, jak upravit svůj workflow a jak překonat nejčastější výzvy z praxe. To tě jasně odliší od ostatních datových vědců.