Selezionare colonne
Il modo più semplice per manipolare i data frame salvati in Spark è usare la sintassi di dplyr. La manipolazione dei data frame con la sintassi di dplyr è trattata in dettaglio nei corsi Data Manipulation with dplyr e Joining Data with dplyr, ma nel prossimo capitolo e mezzo ripasserai tutti i punti importanti.
dplyr ha cinque azioni principali che puoi eseguire su un data frame: puoi selezionare colonne, filtrare righe, ordinare le righe, modificare colonne o aggiungerne di nuove e calcolare statistiche di riepilogo.
Partiamo dalla selezione delle colonne. Si fa chiamando select() su una tibble, seguito dai nomi non quotati delle colonne che vuoi mantenere. Le funzioni di dplyr si usano convenzionalmente con l'operatore pipe di magrittr, %>%. Per selezionare le colonne x, y e z, scriveresti quanto segue.
a_tibble %>%
select(x, y, z)
Nota che l'indicizzazione con parentesi quadre al momento non è supportata in sparklyr. Quindi non puoi fare
a_tibble[, c("x", "y", "z")]
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.
- Seleziona
artist_name,release,titleeyearusandoselect(). - Prova a fare la stessa cosa usando l'indicizzazione con parentesi quadre. Spoiler! Questo codice genera un errore, quindi è racchiuso in una chiamata a
tryCatch().
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)