Kom igångKom igång gratis

Välja unika rader

Om du har en kategorisk variabel lagrad i en faktor är det ofta användbart att veta vilka enskilda kategorier som finns – det gör du med funktionen levels(). För en tibble är det mer generella begreppet att hitta rader med unika data. I linje med SQL-terminologin görs detta med funktionen distinct(). Du kan använda den direkt på din datamängd för att hitta unika kombinationer av värden i en given uppsättning kolumner. Till exempel skriver du så här för att hitta de unika kombinationerna av värden i kolumnerna x, y och z.

a_tibble %>%
  distinct(x, y, z)

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata som lagras i Spark har fördefinieras som track_metadata_tbl.

  • Hitta de distinkta värdena i kolumnen artist_name från track_metadata_tbl.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Redigera och kör kod