Začněte nyníZačněte zdarma

Výběr sloupců

Nejjednodušší způsob, jak pracovat s datovými rámci uloženými ve Sparku, je použít syntaxi dplyr. Manipulaci s datovými rámci pomocí dplyr se podrobně věnují kurzy Data Manipulation with dplyr a Joining Data with dplyr – my si ale všechny důležité koncepty projdeme v průběhu příští kapitoly.

dplyr nabízí pět základních operací, které lze s datovým rámcem provádět: výběr sloupců, filtrování řádků, řazení řádků, úprava nebo přidávání sloupců a výpočet souhrnných statistik.

Začneme výběrem sloupců. K tomu slouží funkce select(), které předáš tibble a poté nekotované názvy sloupců, které chceš ponechat. Funkce dplyr se standardně používají s pipe operátorem %>% z balíčku magrittr. Pro výběr sloupců x, y a z bys napsal/a toto:

a_tibble %>%
  select(x, y, z)

Měj na paměti, že indexování pomocí hranatých závorek v sparklyr zatím není podporováno. Následující kód tedy nefunguje:

a_tibble[, c("x", "y", "z")]

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je již k dispozici jako spark_conn. Tibble navázaný na metadata skladeb uložená ve Sparku je předdefinovaný jako track_metadata_tbl.

  • Vyber sloupce artist_name, release, title a year pomocí select().
  • Zkus totéž provést pomocí indexování hranatými závorkami. Pozor – tento kód vyvolá chybu, proto je zabalen do volání tryCatch().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Upravit a spustit kód