Wybieranie kolumn
Najwygodniejszy sposób manipulowania ramkami danych przechowywanymi w Sparku to składnia dplyr. Szczegółowo omawiają ją kursy Data Manipulation with dplyr oraz Joining Data with dplyr, ale przez następny rozdział i połowę kolejnego samodzielnie przejdziemy przez wszystkie najważniejsze zagadnienia.
dplyr oferuje pięć podstawowych operacji na ramkach danych: wybieranie kolumn, filtrowanie wierszy, porządkowanie wierszy, modyfikowanie lub dodawanie kolumn oraz obliczanie statystyk podsumowujących.
Zacznijmy od wybierania kolumn. Służy do tego funkcja select(), której przekazujesz tibble, a następnie nazwy kolumn do zachowania – bez cudzysłowów. Funkcje dplyr są standardowo stosowane z operatorem pipe %>% z pakietu magrittr. Aby wybrać kolumny x, y i z, napisz:
a_tibble %>%
select(x, y, z)
Zwróć uwagę, że indeksowanie za pomocą nawiasów kwadratowych nie jest obecnie obsługiwane w sparklyr. Oznacza to, że poniższy zapis nie zadziała:
a_tibble[, c("x", "y", "z")]
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Instrukcje do ćwiczenia
Połączenie ze Sparkiem zostało już dla ciebie utworzone jako spark_conn. Tibble powiązany z metadanymi utworów przechowywanymi w Sparku jest wstępnie zdefiniowany jako track_metadata_tbl.
- Wybierz kolumny
artist_name,release,titleiyearza pomocąselect(). - Spróbuj zrobić to samo, używając indeksowania nawiasami kwadratowymi. Uwaga – ten kod spowoduje błąd, dlatego jest opakowany w wywołanie
tryCatch().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)