Inizia subitoInizia gratis

Gruppi di mutanti

Oltre a calcolare statistiche riassuntive per gruppo, puoi modificare le colonne con valori specifici del gruppo. Per esempio, una tecnica per normalizzare i valori è sottrarre la media e poi dividere per la deviazione standard. Puoi effettuare una normalizzazione per gruppo usando il codice seguente.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

È stata creata per te una connessione Spark chiamata spark_conn. È stata inoltre predefinita una tibble collegata ai metadati delle tracce archiviati in Spark come track_metadata_tbl.

  • Raggruppa il contenuto di track_metadata per artist_name.
  • Aggiungi una nuova colonna chiamata time_since_first_release.
    • Impostala uguale a year per gruppo meno il primo year (cioè il min() di year) in cui l'artista ha pubblicato una traccia.
  • Ordina le righe in ordine decrescente di time_since_first_release.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Modifica ed esegui il codice