ÎncepețiÎncepe gratuit

Grupuri de mutații

Pe lângă calcularea statisticilor de sinteză pe grupuri, poți aplica mutate() pentru a adăuga coloane cu valori specifice fiecărui grup. De exemplu, o tehnică de normalizare a valorilor constă în a scădea media și a împărți la abaterea standard. Normalizarea specifică pe grup se poate realiza cu următorul cod.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat metadatelor despre piese stocate în Spark a fost predefinit ca track_metadata_tbl.

  • Grupează conținutul lui track_metadata după artist_name.
  • Adaugă o nouă coloană numită time_since_first_release.
    • Definește-o ca diferența dintre year la nivel de grup și primul year (adică min() year) în care artistul a lansat o piesă.
  • Ordonează rândurile în ordine descrescătoare după time_since_first_release.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Editează și rulează codul