Välja unika rader
Om du har en kategorisk variabel lagrad i en faktor är det ofta användbart att veta vilka enskilda kategorier som finns – det gör du med funktionen levels(). För en tibble är det mer generella begreppet att hitta rader med unika data. I linje med SQL-terminologin görs detta med funktionen distinct(). Du kan använda den direkt på din datamängd för att hitta unika kombinationer av värden i en given uppsättning kolumner. Till exempel skriver du så här för att hitta de unika kombinationerna av värden i kolumnerna x, y och z.
a_tibble %>%
distinct(x, y, z)
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata som lagras i Spark har fördefinieras som track_metadata_tbl.
- Hitta de distinkta värdena i kolumnen
artist_namefråntrack_metadata_tbl.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___