Začněte nyníZačněte zdarma

Proč shuffle zpomaluje dotazy

Tvůj manažer ve Global Retail Analytics tě požádá, abys obohatil/a dataset online_retail (přes 100 000 řádků) o data o regionech z tabulky country_lookup (44 řádků). Napíšeš standardní left join, ale dotaz trvá několik minut. Zkušený inženýr se podívá na výstup .explain(), všimne si uzlů ShuffleExchange a řekne ti: „Твůj bottleneck je shuffle."

Co tím zkušený inženýr myslí?

Toto cvičení je součástí kurzu

Transformace dat pomocí Spark SQL v Databricks

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení