ÎncepețiÎncepe gratuit

Selectarea rândurilor unice

Dacă ai o variabilă categorică stocată într-un factor, este adesea util să știi care sunt categoriile individuale – acest lucru se face cu funcția levels(). În cazul unui tibble, conceptul mai general este să găsești rândurile cu date unice. Urmând terminologia din SQL, acest lucru se realizează cu funcția distinct(). O poți folosi direct pe setul tău de date pentru a identifica combinațiile unice ale unui anumit set de coloane. De exemplu, pentru a găsi combinațiile unice de valori din coloanele x, y și z, ai scrie următorul cod.

a_tibble %>%
  distinct(x, y, z)

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele track-urilor stocate în Spark a fost predefinit ca track_metadata_tbl.

  • Găsește valorile distincte ale coloanei artist_name din track_metadata_tbl.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Editează și rulează codul