Sammanfatta kolumner
Funktionen mutate() som du såg i föregående övning tar kolumner som indata och returnerar en kolumn. När du beräknar sammanfattande statistik – till exempel medelvärde, maximum eller standardavvikelse – vill du vanligtvis ta kolumner som indata men returnera ett enda värde. Det uppnår du med funktionen summarize().
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
Observera att dplyr har filosofin (som förs vidare till sparklyr) att alltid hålla data i tibbles. Returvärdet är därför en tibble med en rad och en kolumn för varje sammanfattande statistik som beräknades.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark är fördefinierad som track_metadata_tbl.
- Välj fälten
titleochduration. - Skicka resultatet vidare med ett rör för att skapa ett nytt fält,
duration_minutes, som innehåller spårets längd i minuter. - Skicka resultatet vidare med ett rör till
summarize()för att beräkna den genomsnittliga längden i minuter, i ett fält med namnetmean_duration_minutes.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___