Optymalizacja rozmiaru plików
Wyobraź sobie, że masz do dyspozycji 2 duże pliki danych w klastrze z 10 węzłami. Każdy plik zawiera 10 mln wierszy o zbliżonym rozmiarze. Podczas pracy z danymi responsywność jest zadowalająca, ale początkowy odczyt plików zajmuje dużo czasu. Dane są używane wyłącznie przez ciebie i zmieniają się przy każdym uruchomieniu.
Które z poniższych rozwiązań najlepiej poprawi wydajność?
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie