or
Toto cvičení je součástí kurzu
V této kapitole se naučíš vytvářet a dotazovat SQL tabulky ve Sparku. Spark SQL přináší do Sparku plnou expresivitu SQL. Také se seznámíš s okenními funkcemi SQL ve Sparku. Okenní funkce provádějí výpočty přes řádky, které jsou v určitém vztahu k aktuálnímu řádku, a výrazně zjednodušují operace, které by pomocí samotných spojení a tradičních agregací byly obtížně vyjádřitelné. Okenní funkce využijeme k výpočtu průběžných součtů, průběžných rozdílů a dalších operací, které jsou v základním SQL náročné na implementaci.
V této kapitole načteš text v přirozeném jazyce a aplikuješ analýzu pohyblivého okna k vyhledávání častých slovních sekvencí.
V předchozích kapitolách sis osvojil/a expresivitu okenních funkcí SQL. Tato expresivita ale zároveň zdůrazňuje, jak důležité je správně pracovat s mezipamětí DataFrames a SQL tabulek. Stejně důležité je umět vyhodnocovat výkon své aplikace – k tomu slouží Spark UI. Naučíš se také osvědčené postupy pro logování ve Sparku. Spark SQL navíc nabízí užitečný nástroj pro ladění výkonu dotazů: plán provádění dotazu. Ukážeme si, jak ho využít k analýze původu DataFramu.
Předchozí kapitoly ti daly nástroje pro načítání surového textu, jeho tokenizaci a extrakci slovních sekvencí. To je samo o sobě velmi užitečné pro analýzu, ale hodí se i pro strojové učení. Vše, co ses naučil/a, teď spojíš dohromady při klasifikaci textu pomocí logistické regrese. Na konci této kapitoly budeš mít za sebou načtení surových dat v přirozeném jazyce a jejich využití k natrénování textového klasifikátoru.
Aktuální cvičení