Kom igångKom igång gratis

Grupper av mutationer

Förutom att beräkna sammanfattande statistik per grupp kan du också mutera kolumner med gruppspecifika värden. En vanlig teknik för att normalisera värden är till exempel att subtrahera medelvärdet och sedan dividera med standardavvikelsen. Du kan utföra gruppspecifik normalisering med följande kod.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.

  • Gruppera innehållet i track_metadata efter artist_name.
  • Lägg till en ny kolumn med namnet time_since_first_release.
    • Sätt den lika med det gruppvisa year minus det första year (det vill säga min() year) då artisten släppte ett spår.
  • Sortera raderna i fallande ordning efter time_since_first_release.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Redigera och kör kod