Optimalizace velikosti souborů
Představ si, že máš na clusteru s 10 uzly k dispozici 2 velké datové soubory. Každý obsahuje 10 milionů řádků přibližně stejné velikosti. Při práci s daty je odezva přijatelná, ale počáteční načtení souborů trvá příliš dlouho. Data používáš pouze ty a při každém spuštění se mění.
Která z následujících možností nejlépe zlepší výkon?
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení