Modificare le colonne
Potrà sorprenderti, ma non tutti gli insiemi di dati nascono perfettamente puliti! Spesso devi correggere valori o creare nuove colonne a partire dai dati esistenti. Il processo di modifica o aggiunta di colonne in dplyr si chiama mutation e si effettua con mutate(). Questa funzione prende una tibble e argomenti nominati per aggiornare le colonne. Il nome di ciascun argomento è il nome della colonna da modificare o aggiungere e il valore è un’espressione che spiega come aggiornarla. Ad esempio, data una tibble con colonne x e y, il codice seguente aggiorna x e crea una nuova colonna z.
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
Nel caso non fosse ancora chiaro che le funzioni di base R non funzionano con le tibble di Spark, non puoi usare within() o transform() per questo scopo.
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark chiamata spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.
- Seleziona i campi
titleeduration. Nota che le durate sono in secondi. - Passa il risultato a
mutate()per creare un nuovo campo,duration_minutes, che contenga la durata della traccia in minuti.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___