Začněte nyníZačněte zdarma

Výběr unikátních řádků

Pokud máš kategorickou proměnnou uloženou jako faktor, hodí se vědět, jaké jednotlivé kategorie obsahuje – k tomu slouží funkce levels(). U tibble je obecnějším přístupem hledání řádků s unikátními daty. Podle terminologie SQL se k tomu používá funkce distinct(). Můžeš ji použít přímo na svůj dataset a najít tak unikátní kombinace hodnot v určité sadě sloupců. Například pro nalezení unikátních kombinací hodnot ve sloupcích x, y a z napíšeš následující.

a_tibble %>%
  distinct(x, y, z)

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojená na metadata skladeb uložená ve Sparku je předem definovaná jako track_metadata_tbl.

  • Najdi unikátní hodnoty sloupce artist_name z track_metadata_tbl.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Upravit a spustit kód