De shuffle-bottleneck begrijpen
Je manager bij Global Retail Analytics vraagt je om de online_retail-gegevensset (meer dan 100.000 rijen) te verrijken met regiogegevens uit country_lookup (44 rijen). Je schrijft een standaard left join, maar de query duurt enkele minuten. Een senior engineer bekijkt je .explain()-output, ziet ShuffleExchange-nodes en zegt: "De shuffle is je bottleneck."
Wat bedoelt de senior engineer met "de shuffle"?
Deze oefening maakt deel uit van de cursus
Gegevens transformeren met Spark SQL in Databricks
Interactieve oefening met praktijkervaring
Zet theorie om in actie met een van onze interactieve oefeningen
Begin oefening