Copierea datelor în Spark
Înainte de a putea lucra efectiv cu Spark, trebuie să îți introduci datele în el. sparklyr oferă funcții precum spark_read_csv(), care citesc un fișier CSV direct în Spark. Mai general, este util să poți copia date din R în Spark. Acest lucru se realizează cu funcția copy_to() din dplyr. Reține: copierea datelor este un proces intrinsec lent. De fapt, o mare parte din strategiile de optimizare a performanței atunci când lucrezi cu seturi de date mari vizează tocmai evitarea copierii datelor dintr-un loc în altul.
copy_to() primește două argumente: o conexiune Spark (dest) și un cadru de date (df) de copiat în Spark.
Odată ce ai copiat datele în Spark, poate vrei să te asiguri că totul a funcționat corect. Poți vedea lista tuturor cadrelor de date stocate în Spark folosind src_tbls(), care primește ca argument doar conexiunea Spark (x).
Pe parcursul acestui curs, vei explora metadate despre piese muzicale din Million Song Dataset. Deși Spark scalează cu ușurință la mult peste un milion de rânduri, pentru a păstra lucrurile simple și rapide, vei lucra cu un subset de o mie de piese. O clarificare terminologică: o piesă corespunde unui rând din setul de date. În subsetul tău de o mie de piese, aceasta este echivalentă cu un cântec (deși setul complet de un milion de rânduri conținea unele duplicate).
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
track_metadata, care conține numele piesei, numele artistului și alte metadate pentru 1.000 de piese, a fost predefinit în spațiul tău de lucru.
- Folosește
str()pentru a explora setul de datetrack_metadata. - Conectează-te la clusterul tău Spark local și stochează conexiunea în
spark_conn. - Copiază
track_metadataîn clusterul Spark folosindcopy_to(). - Verifică ce cadre de date sunt disponibile în Spark folosind
src_tbls(). - Deconectează-te de la Spark.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load dplyr
___
# Explore track_metadata structure
___
# Connect to your Spark cluster
spark_conn <- spark_connect("___")
# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)
# List the data frames available in Spark
___(___)
# Disconnect from Spark
spark_disconnect(___)