Inizia subitoInizia gratis

Modificare le colonne

Potrà sorprenderti, ma non tutti gli insiemi di dati nascono perfettamente puliti! Spesso devi correggere valori o creare nuove colonne a partire dai dati esistenti. Il processo di modifica o aggiunta di colonne in dplyr si chiama mutation e si effettua con mutate(). Questa funzione prende una tibble e argomenti nominati per aggiornare le colonne. Il nome di ciascun argomento è il nome della colonna da modificare o aggiungere e il valore è un’espressione che spiega come aggiornarla. Ad esempio, data una tibble con colonne x e y, il codice seguente aggiorna x e crea una nuova colonna z.

a_tibble %>%
  mutate(
    x = x + y,
    z = log(x)  
  )

Nel caso non fosse ancora chiaro che le funzioni di base R non funzionano con le tibble di Spark, non puoi usare within() o transform() per questo scopo.

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

È stata creata per te una connessione Spark chiamata spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.

  • Seleziona i campi title e duration. Nota che le durate sono in secondi.
  • Passa il risultato a mutate() per creare un nuovo campo, duration_minutes, che contenga la durata della traccia in minuti.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___
Modifica ed esegui il codice