Le modèle connecter-travailler-déconnecter
Travailler avec sparklyr ressemble beaucoup à travailler avec dplyr lorsque vos données se trouvent dans une base de données. En fait, sparklyr convertit votre code R en code SQL avant de l'envoyer à Spark.
Le déroulement type comprend trois étapes :
- Se connecter à Spark avec
spark_connect(). - Faire le travail.
- Fermer la connexion à Spark avec
spark_disconnect().
Dans cet exercice, vous ferez la tâche la plus simple qui soit : récupérer la version de Spark en cours d'exécution, à l'aide de spark_version().
spark_connect() prend une URL qui indique l'emplacement de Spark. Pour un grappe locale (comme celle que vous exécutez), l'URL doit être "local". Pour une grappe distante (sur une autre machine, généralement un serveur haute performance), la chaîne de connexion sera une URL et un port sur lesquels se connecter.
spark_version() et spark_disconnect() prennent toutes deux la connexion Spark comme seul argument.
Un mot d'avertissement. L'établissement d'une connexion à une grappe prend plusieurs secondes, donc il n'est pas pratique de se connecter et de se déconnecter fréquemment. Même si vous devez vous reconnecter pour chaque exercice DataCamp, lorsque vous intégrez sparklyr à votre propre flux de travail, il est généralement préférable de garder la connexion ouverte pendant toute la durée de votre travail avec Spark.
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
- Chargez le paquet
sparklyraveclibrary(). - Connectez-vous à Spark en appelant
spark_connect()avec l'argumentmaster = "local". Assignez le résultat àspark_conn. - Obtenez la version de Spark avec
spark_version()en passant l'argumentsc = spark_conn. - Fermez la connexion à Spark avec
spark_disconnect()en passant l'argumentsc = spark_conn.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___