Välja kolumner
Det enklaste sättet att manipulera dataramer lagrade i Spark är att använda dplyr-syntax. Hur man manipulerar dataramer med dplyr-syntax behandlas utförligt i kurserna Data Manipulation with dplyr och Joining Data with dplyr, men du kommer att ägna nästa kapitel och ett halvt åt att gå igenom de viktigaste momenten.
dplyr har fem huvudsakliga åtgärder du kan utföra på en dataramar. Du kan välja kolumner, filtrera rader, sortera rader, ändra eller lägga till kolumner samt beräkna sammanfattande statistik.
Låt oss börja med att välja kolumner. Det görs genom att anropa select() med en tibble följt av de kolumnnamn du vill behålla, utan citationstecken. dplyr-funktioner används vanligtvis tillsammans med magrittr's pipe-operator, %>%. För att välja kolumnerna x, y och z skriver du följande.
a_tibble %>%
select(x, y, z)
Observera att indexering med hakparentes för närvarande inte stöds i sparklyr. Det går alltså inte att skriva
a_tibble[, c("x", "y", "z")]
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.
- Välj kolumnerna
artist_name,release,titleochyearmed hjälp avselect(). - Försök göra samma sak med hakparentesindexering. Spoiler! Den här koden ger ett felmeddelande och är därför inkapslad i ett anrop till
tryCatch().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)