Kom igångKom igång gratis

Kopiera data till Spark

Innan du kan göra något verkligt arbete med Spark behöver du få in dina data i det. sparklyr har funktioner som spark_read_csv() som läser en CSV-fil direkt in i Spark. Mer generellt är det användbart att kunna kopiera data från R till Spark. Det görs med dplyrs funktion copy_to(). En varning: att kopiera data är i grunden en långsam process. Mycket av strategin kring prestandaoptimering vid arbete med stora datamängder handlar just om att undvika att flytta data från en plats till en annan.

copy_to() tar två argument: en Spark-anslutning (dest) och en dataram (df) som ska kopieras till Spark.

När du har kopierat dina data till Spark kanske du vill bekräfta att det faktiskt fungerade. Du kan se en lista över alla dataramar som lagras i Spark med src_tbls(), som tar en Spark-anslutning som argument (x).

Genomgående i kursen utforskar du spårmetadata från Million Song Dataset. Spark hanterar utan problem långt mer än en miljon rader, men för att hålla det enkelt och snabbt använder du ett urval på tusen spår. En kort förklaring av terminologin: ett spår (track) motsvarar en rad i datamängden. I ditt urval på tusen spår är detta detsamma som en låt (även om den fullständiga datamängden med en miljon rader innehöll vissa dubbletter).

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

track_metadata, som innehåller låtnamn, artistnamn och annan metadata för 1 000 spår, har redan definierats i din arbetsmiljö.

  • Använd str() för att utforska datamängden track_metadata.
  • Anslut till ditt lokala Spark-kluster och lagra anslutningen i spark_conn.
  • Kopiera track_metadata till Spark-klustret med copy_to().
  • Se vilka dataramar som finns tillgängliga i Spark med src_tbls().
  • Koppla från Spark.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load dplyr
___

# Explore track_metadata structure
___

# Connect to your Spark cluster
spark_conn <- spark_connect("___")

# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)

# List the data frames available in Spark
___(___)

# Disconnect from Spark
spark_disconnect(___)
Redigera och kör kod