Proč shuffle zpomaluje dotazy
Tvůj manažer ve Global Retail Analytics tě požádá, abys obohatil/a dataset online_retail (přes 100 000 řádků) o data o regionech z tabulky country_lookup (44 řádků). Napíšeš standardní left join, ale dotaz trvá několik minut. Zkušený inženýr se podívá na výstup .explain(), všimne si uzlů ShuffleExchange a řekne ti: „Твůj bottleneck je shuffle."
Co tím zkušený inženýr myslí?
Toto cvičení je součástí kurzu
Transformace dat pomocí Spark SQL v Databricks
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení