Aan de slagBegin gratis

Kolommen selecteren

De makkelijkste manier om dataframes die in Spark staan te bewerken, is met dplyr-syntaxis. Werken met dataframes met dplyr komt uitgebreid aan bod in de cursussen Data Manipulation with dplyr en Joining Data with dplyr, maar in het komende hoofdstuk en een half behandel je alle belangrijke punten.

dplyr heeft vijf hoofdacties die je op een dataframe kunt uitvoeren. Je kunt kolommen selecteren, rijen filteren, de volgorde van rijen aanpassen, kolommen wijzigen of nieuwe kolommen toevoegen, en samenvattende statistieken berekenen.

Laten we beginnen met kolommen selecteren. Dit doe je door select() aan te roepen met een tibble, gevolgd door de ongenoteerde namen van de kolommen die je wilt behouden. dplyr-functies gebruik je doorgaans met de pipe-operator van magrittr, %>%. Om de kolommen x, y en z te selecteren, schrijf je het volgende.

a_tibble %>%
  select(x, y, z)

Let op: indexeren met blokhaken wordt momenteel niet ondersteund in sparklyr. Je kunt dus niet

a_tibble[, c("x", "y", "z")]

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble die is gekoppeld aan de trackmetadata in Spark is vooraf gedefinieerd als track_metadata_tbl.

  • Selecteer artist_name, release, title en year met select().
  • Probeer hetzelfde te doen met indexeren via blokhaken. Spoiler! Deze code geeft een fout en is daarom verpakt in een aanroep van tryCatch().

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Code bewerken en uitvoeren