Aan de slagBegin gratis

De shuffle-bottleneck begrijpen

Je manager bij Global Retail Analytics vraagt je om de online_retail-gegevensset (meer dan 100.000 rijen) te verrijken met regiogegevens uit country_lookup (44 rijen). Je schrijft een standaard left join, maar de query duurt enkele minuten. Een senior engineer bekijkt je .explain()-output, ziet ShuffleExchange-nodes en zegt: "De shuffle is je bottleneck."

Wat bedoelt de senior engineer met "de shuffle"?

Deze oefening maakt deel uit van de cursus

Gegevens transformeren met Spark SQL in Databricks

Bekijk cursus

Interactieve oefening met praktijkervaring

Zet theorie om in actie met een van onze interactieve oefeningen

Begin oefening