Grupper av mutationer
Förutom att beräkna sammanfattande statistik per grupp kan du också mutera kolumner med gruppspecifika värden. En vanlig teknik för att normalisera värden är till exempel att subtrahera medelvärdet och sedan dividera med standardavvikelsen. Du kan utföra gruppspecifik normalisering med följande kod.
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.
- Gruppera innehållet i
track_metadataefterartist_name. - Lägg till en ny kolumn med namnet
time_since_first_release.- Sätt den lika med det gruppvisa
yearminus det förstayear(det vill sägamin()year) då artisten släppte ett spår.
- Sätt den lika med det gruppvisa
- Sortera raderna i fallande ordning efter
time_since_first_release.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___