Kom igångKom igång gratis

Sammanfatta kolumner

Funktionen mutate() som du såg i föregående övning tar kolumner som indata och returnerar en kolumn. När du beräknar sammanfattande statistik – till exempel medelvärde, maximum eller standardavvikelse – vill du vanligtvis ta kolumner som indata men returnera ett enda värde. Det uppnår du med funktionen summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Observera att dplyr har filosofin (som förs vidare till sparklyr) att alltid hålla data i tibbles. Returvärdet är därför en tibble med en rad och en kolumn för varje sammanfattande statistik som beräknades.

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark är fördefinierad som track_metadata_tbl.

  • Välj fälten title och duration.
  • Skicka resultatet vidare med ett rör för att skapa ett nytt fält, duration_minutes, som innehåller spårets längd i minuter.
  • Skicka resultatet vidare med ett rör till summarize() för att beräkna den genomsnittliga längden i minuter, i ett fält med namnet mean_duration_minutes.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Redigera och kör kod