Výběr unikátních řádků
Pokud máš kategorickou proměnnou uloženou jako faktor, hodí se vědět, jaké jednotlivé kategorie obsahuje – k tomu slouží funkce levels(). U tibble je obecnějším přístupem hledání řádků s unikátními daty. Podle terminologie SQL se k tomu používá funkce distinct(). Můžeš ji použít přímo na svůj dataset a najít tak unikátní kombinace hodnot v určité sadě sloupců. Například pro nalezení unikátních kombinací hodnot ve sloupcích x, y a z napíšeš následující.
a_tibble %>%
distinct(x, y, z)
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojená na metadata skladeb uložená ve Sparku je předem definovaná jako track_metadata_tbl.
- Najdi unikátní hodnoty sloupce
artist_nameztrack_metadata_tbl.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___