Wybieranie unikalnych wierszy
Jeśli masz zmienną kategoryczną przechowywaną w czynniku (factor), często warto wiedzieć, jakie są poszczególne kategorie – służy do tego funkcja levels(). W przypadku tibble bardziej ogólnym podejściem jest wyszukiwanie wierszy z unikalnymi danymi. Zgodnie z terminologią SQL robi się to za pomocą funkcji distinct(). Możesz użyć jej bezpośrednio na swoim zbiorze danych, aby znaleźć unikalne kombinacje wartości w określonym zestawie kolumn. Na przykład, aby znaleźć unikalne kombinacje wartości w kolumnach x, y i z, napisz poniższy kod.
a_tibble %>%
distinct(x, y, z)
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Instrukcje do ćwiczenia
Połączenie ze Sparkiem zostało już utworzone jako spark_conn. Tibble powiązany z metadanymi utworów przechowywanymi w Sparku jest predefiniowany jako track_metadata_tbl.
- Znajdź unikalne wartości kolumny
artist_nameztrack_metadata_tbl.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___