Kom igångKom igång gratis

Mutera kolumner

Det kanske förvånar dig, men alla datamängder är inte perfekt strukturerade från början! Ofta behöver du korrigera värden eller skapa nya kolumner baserade på befintlig data. Processen att ändra eller lägga till kolumner kallas mutation i dplyr-terminologi och utförs med mutate(). Funktionen tar en tibble och namngivna argument för att uppdatera kolumner. Namnet på varje argument är namnet på den kolumn som ska ändras eller läggas till, och värdet är ett uttryck som beskriver hur den ska uppdateras. Givet en tibble med kolumnerna x och y skulle följande kod uppdatera x och skapa en ny kolumn z.

a_tibble %>%
  mutate(
    x = x + y,
    z = log(x)  
  )

Om du inte redan fått budskapet: vanliga R-funktioner fungerar inte med Spark-tibbles. Du kan alltså inte använda within() eller transform() för det här ändamålet.

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefanierats som track_metadata_tbl.

  • Välj fälten title och duration. Observera att varaktigheterna anges i sekunder.
  • Skicka resultatet vidare med pipe till mutate() för att skapa ett nytt fält, duration_minutes, som innehåller spårets varaktighet i minuter.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___
Redigera och kör kod