Selectarea coloanelor
Cel mai simplu mod de a manipula date frames stocate în Spark este să folosești sintaxa dplyr. Manipularea data frames-urilor cu sintaxa dplyr este tratată în detaliu în cursurile Data Manipulation with dplyr și Joining Data with dplyr, dar în capitolul următor și jumătate vei parcurge toate aspectele importante.
dplyr oferă cinci acțiuni principale pe care le poți efectua asupra unui data frame: selectarea coloanelor, filtrarea rândurilor, ordonarea rândurilor, modificarea sau adăugarea de coloane și calcularea statisticilor rezumative.
Să începem cu selectarea coloanelor. Aceasta se realizează prin apelarea select(), cu un tibble, urmat de numele neghilimitate ale coloanelor pe care vrei să le păstrezi. Funcțiile dplyr se folosesc de obicei împreună cu operatorul pipe al lui magrittr, %>%. Pentru a selecta coloanele x, y și z, ai scrie următorul cod.
a_tibble %>%
select(x, y, z)
Reține că indexarea cu paranteze pătrate nu este momentan suportată în sparklyr. Prin urmare, nu poți folosi
a_tibble[, c("x", "y", "z")]
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
O conexiune Spark a fost creată pentru tine sub numele spark_conn. Un tibble asociat metadatelor pistelor stocate în Spark a fost predefinit ca track_metadata_tbl.
- Selectează coloanele
artist_name,release,titleșiyearfolosindselect(). - Încearcă să faci același lucru folosind indexarea cu paranteze pătrate. Atenție! Acest cod generează o eroare, deci este inclus într-un apel la
tryCatch().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)