Inizia subitoInizia gratis

Selezionare colonne

Il modo più semplice per manipolare i data frame salvati in Spark è usare la sintassi di dplyr. La manipolazione dei data frame con la sintassi di dplyr è trattata in dettaglio nei corsi Data Manipulation with dplyr e Joining Data with dplyr, ma nel prossimo capitolo e mezzo ripasserai tutti i punti importanti.

dplyr ha cinque azioni principali che puoi eseguire su un data frame: puoi selezionare colonne, filtrare righe, ordinare le righe, modificare colonne o aggiungerne di nuove e calcolare statistiche di riepilogo.

Partiamo dalla selezione delle colonne. Si fa chiamando select() su una tibble, seguito dai nomi non quotati delle colonne che vuoi mantenere. Le funzioni di dplyr si usano convenzionalmente con l'operatore pipe di magrittr, %>%. Per selezionare le colonne x, y e z, scriveresti quanto segue.

a_tibble %>%
  select(x, y, z)

Nota che l'indicizzazione con parentesi quadre al momento non è supportata in sparklyr. Quindi non puoi fare

a_tibble[, c("x", "y", "z")]

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.

  • Seleziona artist_name, release, title e year usando select().
  • Prova a fare la stessa cosa usando l'indicizzazione con parentesi quadre. Spoiler! Questo codice genera un errore, quindi è racchiuso in una chiamata a tryCatch().

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Modifica ed esegui il codice