or
To ćwiczenie jest częścią kursu
W tym rozdziale nauczysz się tworzyć i odpytywać tabele SQL w Sparku. Spark SQL wprowadza do Sparka pełną ekspresywność języka SQL. Poznasz też funkcje okna SQL w Sparku. Funkcje okna wykonują obliczenia na wierszach powiązanych z bieżącym wierszem, dzięki czemu znacznie upraszczają uzyskiwanie wyników, które trudno wyrazić za pomocą samych złączeń i tradycyjnych agregacji. Użyjemy funkcji okna do obliczania sum bieżących, różnic bieżących i innych operacji, które w podstawowym SQL są trudne do wykonania.
W tym rozdziale wczytasz tekst w języku naturalnym, a następnie zastosujesz analizę ruchomego okna, aby znaleźć częste sekwencje słów.
W poprzednich rozdziałach poznałeś ekspresywność funkcji okna SQL. Teraz ważne jest, abyś zrozumiał, jak poprawnie buforować ramki danych i tabele SQL. Równie istotna jest umiejętność oceny działania aplikacji – do tego celu służy Spark UI. Poznasz też sprawdzone praktyki logowania w Sparku. Spark SQL oferuje jeszcze jedno przydatne narzędzie do optymalizacji zapytań: plan wykonania zapytania. Nauczysz się go używać do analizy pochodzenia ramki danych.
Bieżące ćwiczenie
Poprzednie rozdziały wyposażyły cię w narzędzia do wczytywania surowego tekstu, jego tokenizacji i wyodrębniania sekwencji słów. To samo w sobie jest bardzo przydatne do analizy, ale sprawdza się też w uczeniu maszynowym. Teraz połączysz zdobytą wiedzę, stosując regresję logistyczną do klasyfikacji tekstu. Po ukończeniu tego rozdziału wczytasz surowe dane tekstowe w języku naturalnym i użyjesz ich do wytrenowania klasyfikatora tekstu.