Zacznij terazZacznij za darmo

Optymalizacja rozmiaru plików

Wyobraź sobie, że masz do dyspozycji 2 duże pliki danych w klastrze z 10 węzłami. Każdy plik zawiera 10 mln wierszy o zbliżonym rozmiarze. Podczas pracy z danymi responsywność jest zadowalająca, ale początkowy odczyt plików zajmuje dużo czasu. Dane są używane wyłącznie przez ciebie i zmieniają się przy każdym uruchomieniu.

Które z poniższych rozwiązań najlepiej poprawi wydajność?

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie