Zacznij terazZacznij za darmo

Wybieranie unikalnych wierszy

Jeśli masz zmienną kategoryczną przechowywaną w czynniku (factor), często warto wiedzieć, jakie są poszczególne kategorie – służy do tego funkcja levels(). W przypadku tibble bardziej ogólnym podejściem jest wyszukiwanie wierszy z unikalnymi danymi. Zgodnie z terminologią SQL robi się to za pomocą funkcji distinct(). Możesz użyć jej bezpośrednio na swoim zbiorze danych, aby znaleźć unikalne kombinacje wartości w określonym zestawie kolumn. Na przykład, aby znaleźć unikalne kombinacje wartości w kolumnach x, y i z, napisz poniższy kod.

a_tibble %>%
  distinct(x, y, z)

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark z pakietem sparklyr w R

Zobacz kurs

Instrukcje do ćwiczenia

Połączenie ze Sparkiem zostało już utworzone jako spark_conn. Tibble powiązany z metadanymi utworów przechowywanymi w Sparku jest predefiniowany jako track_metadata_tbl.

  • Znajdź unikalne wartości kolumny artist_name z track_metadata_tbl.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Edytuj i uruchom kod