Selectarea rândurilor unice
Dacă ai o variabilă categorică stocată într-un factor, este adesea util să știi care sunt categoriile individuale – acest lucru se face cu funcția levels(). În cazul unui tibble, conceptul mai general este să găsești rândurile cu date unice. Urmând terminologia din SQL, acest lucru se realizează cu funcția distinct(). O poți folosi direct pe setul tău de date pentru a identifica combinațiile unice ale unui anumit set de coloane. De exemplu, pentru a găsi combinațiile unice de valori din coloanele x, y și z, ai scrie următorul cod.
a_tibble %>%
distinct(x, y, z)
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele track-urilor stocate în Spark a fost predefinit ca track_metadata_tbl.
- Găsește valorile distincte ale coloanei
artist_namedintrack_metadata_tbl.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___