Gruppi di mutanti
Oltre a calcolare statistiche riassuntive per gruppo, puoi modificare le colonne con valori specifici del gruppo. Per esempio, una tecnica per normalizzare i valori è sottrarre la media e poi dividere per la deviazione standard. Puoi effettuare una normalizzazione per gruppo usando il codice seguente.
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark chiamata spark_conn. È stata inoltre predefinita una tibble collegata ai metadati delle tracce archiviati in Spark come track_metadata_tbl.
- Raggruppa il contenuto di
track_metadataperartist_name. - Aggiungi una nuova colonna chiamata
time_since_first_release.- Impostala uguale a
yearper gruppo meno il primoyear(cioè ilmin()diyear) in cui l'artista ha pubblicato una traccia.
- Impostala uguale a
- Ordina le righe in ordine decrescente di
time_since_first_release.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___