Výběr sloupců
Nejjednodušší způsob, jak pracovat s datovými rámci uloženými ve Sparku, je použít syntaxi dplyr. Manipulaci s datovými rámci pomocí dplyr se podrobně věnují kurzy Data Manipulation with dplyr a Joining Data with dplyr – my si ale všechny důležité koncepty projdeme v průběhu příští kapitoly.
dplyr nabízí pět základních operací, které lze s datovým rámcem provádět: výběr sloupců, filtrování řádků, řazení řádků, úprava nebo přidávání sloupců a výpočet souhrnných statistik.
Začneme výběrem sloupců. K tomu slouží funkce select(), které předáš tibble a poté nekotované názvy sloupců, které chceš ponechat. Funkce dplyr se standardně používají s pipe operátorem %>% z balíčku magrittr. Pro výběr sloupců x, y a z bys napsal/a toto:
a_tibble %>%
select(x, y, z)
Měj na paměti, že indexování pomocí hranatých závorek v sparklyr zatím není podporováno. Následující kód tedy nefunguje:
a_tibble[, c("x", "y", "z")]
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je již k dispozici jako spark_conn. Tibble navázaný na metadata skladeb uložená ve Sparku je předdefinovaný jako track_metadata_tbl.
- Vyber sloupce
artist_name,release,titleayearpomocíselect(). - Zkus totéž provést pomocí indexování hranatými závorkami. Pozor – tento kód vyvolá chybu, proto je zabalen do volání
tryCatch().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)