Kom igångKom igång gratis

Välja kolumner

Det enklaste sättet att manipulera dataramer lagrade i Spark är att använda dplyr-syntax. Hur man manipulerar dataramer med dplyr-syntax behandlas utförligt i kurserna Data Manipulation with dplyr och Joining Data with dplyr, men du kommer att ägna nästa kapitel och ett halvt åt att gå igenom de viktigaste momenten.

dplyr har fem huvudsakliga åtgärder du kan utföra på en dataramar. Du kan välja kolumner, filtrera rader, sortera rader, ändra eller lägga till kolumner samt beräkna sammanfattande statistik.

Låt oss börja med att välja kolumner. Det görs genom att anropa select() med en tibble följt av de kolumnnamn du vill behålla, utan citationstecken. dplyr-funktioner används vanligtvis tillsammans med magrittr's pipe-operator, %>%. För att välja kolumnerna x, y och z skriver du följande.

a_tibble %>%
  select(x, y, z)

Observera att indexering med hakparentes för närvarande inte stöds i sparklyr. Det går alltså inte att skriva

a_tibble[, c("x", "y", "z")]

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.

  • Välj kolumnerna artist_name, release, title och year med hjälp av select().
  • Försök göra samma sak med hakparentesindexering. Spoiler! Den här koden ger ett felmeddelande och är därför inkapslad i ett anrop till tryCatch().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Redigera och kör kod