Selezionare righe uniche
Se hai una variabile categorica memorizzata in un factor, spesso è utile sapere quali sono le singole categorie; puoi farlo con la funzione levels(). Per una tibble, il concetto più generale è trovare le righe con dati unici. Seguendo la terminologia di SQL, questo si fa usando la funzione distinct(). Puoi usarla direttamente sul tuo insieme di dati per trovare combinazioni uniche di un particolare insieme di colonne. Ad esempio, per trovare le combinazioni uniche di valori nelle colonne x, y e z, scriveresti quanto segue.
a_tibble %>%
distinct(x, y, z)
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark chiamata spark_conn. È stata anche predefinita una tibble collegata ai metadati delle tracce memorizzati in Spark, chiamata track_metadata_tbl.
- Trova i valori distinti della colonna
artist_namedatrack_metadata_tbl.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___