Faits l'un pour l'autre
R vous permet d'écrire rapidement du code d'analyse de données. Avec un peu de soin, vous pouvez aussi le rendre facile à lire, ce qui facilite sa maintenance. Dans bien des cas, R est aussi suffisamment rapide à l'exécution.
Malheureusement, R exige que toutes vos données soient analysées en mémoire (RAM) sur une seule machine. Cela limite la quantité de données que vous pouvez analyser avec R. Quelques solutions existent à ce problème, dont l'utilisation de Spark.
Spark est une plateforme de calcul en grappe ouverte. Cela signifie que vous pouvez répartir vos données et vos calculs sur plusieurs machines, ce qui vous permet en pratique d'analyser une quantité illimitée de données. Les deux technologies se complètent très bien. En utilisant R et Spark ensemble, vous pouvez écrire du code rapidement ET l'exécuter rapidement!
sparklyr est un package R qui vous permet d'écrire du code R pour travailler avec des données dans une grappe Spark. Il offre une interface dplyr, ce qui veut dire que vous pouvez écrire (à peu près) le même code R de style dplyr, que vous travailliez avec des données sur votre machine ou sur une grappe Spark.
Criez si vous voulez aller plus vite!
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice