ÎncepețiÎncepe gratuit

Copierea datelor în Spark

Înainte de a putea lucra efectiv cu Spark, trebuie să îți introduci datele în el. sparklyr oferă funcții precum spark_read_csv(), care citesc un fișier CSV direct în Spark. Mai general, este util să poți copia date din R în Spark. Acest lucru se realizează cu funcția copy_to() din dplyr. Reține: copierea datelor este un proces intrinsec lent. De fapt, o mare parte din strategiile de optimizare a performanței atunci când lucrezi cu seturi de date mari vizează tocmai evitarea copierii datelor dintr-un loc în altul.

copy_to() primește două argumente: o conexiune Spark (dest) și un cadru de date (df) de copiat în Spark.

Odată ce ai copiat datele în Spark, poate vrei să te asiguri că totul a funcționat corect. Poți vedea lista tuturor cadrelor de date stocate în Spark folosind src_tbls(), care primește ca argument doar conexiunea Spark (x).

Pe parcursul acestui curs, vei explora metadate despre piese muzicale din Million Song Dataset. Deși Spark scalează cu ușurință la mult peste un milion de rânduri, pentru a păstra lucrurile simple și rapide, vei lucra cu un subset de o mie de piese. O clarificare terminologică: o piesă corespunde unui rând din setul de date. În subsetul tău de o mie de piese, aceasta este echivalentă cu un cântec (deși setul complet de un milion de rânduri conținea unele duplicate).

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

track_metadata, care conține numele piesei, numele artistului și alte metadate pentru 1.000 de piese, a fost predefinit în spațiul tău de lucru.

  • Folosește str() pentru a explora setul de date track_metadata.
  • Conectează-te la clusterul tău Spark local și stochează conexiunea în spark_conn.
  • Copiază track_metadata în clusterul Spark folosind copy_to().
  • Verifică ce cadre de date sunt disponibile în Spark folosind src_tbls().
  • Deconectează-te de la Spark.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load dplyr
___

# Explore track_metadata structure
___

# Connect to your Spark cluster
spark_conn <- spark_connect("___")

# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)

# List the data frames available in Spark
___(___)

# Disconnect from Spark
spark_disconnect(___)
Editează și rulează codul