Začněte nyníZačněte zdarma

Optimalizace velikosti souborů

Představ si, že máš na clusteru s 10 uzly k dispozici 2 velké datové soubory. Každý obsahuje 10 milionů řádků přibližně stejné velikosti. Při práci s daty je odezva přijatelná, ale počáteční načtení souborů trvá příliš dlouho. Data používáš pouze ty a při každém spuštění se mění.

Která z následujících možností nejlépe zlepší výkon?

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení