Hämta data tillbaka från Spark
I övningen "Utforska tibble-strukturen" i kapitel 1 såg du att tibbles inte lagrar en kopia av datan. I stället stannar datan i Spark, och tibbeln lagrar bara information om vad den vill hämta därifrån.
Det finns många anledningar till att flytta data från Spark till R. Du har redan sett hur en del data flyttas från Spark till R när du skriver ut den. Du behöver också samla in din datamängd om du vill visualisera den, eller om du vill använda en modelleringsteknik som inte finns tillgänglig i Spark. (R har trots allt det bredaste urvalet av tillgängliga modeller av alla programmeringsspråk.)
För att samla in din data – det vill säga flytta den från Spark till R – anropar du collect().
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.
- Filtrera raderna i
track_metadata_tbldärartist_familiarityär större än 0,9 och tilldela resultaten tillresults. - Skriv ut klassen för
resultsoch notera att den är entbl_lazy(används för fjärrdata). - Samla in dina resultat och tilldela dem till
collected. - Skriv ut klassen för
collectedoch notera att den är entbl_df(används för lokal data).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___