CommencezCommencez gratuitement

Rapatrier des données depuis Spark

Dans l'exercice « Exploring the structure of tibbles », au chapitre 1, vous avez vu que les tibbles ne stockent pas une copie des données. Les données demeurent plutôt dans Spark, et le tibble conserve simplement les détails de ce qu'il souhaite récupérer de Spark.

Il existe de nombreuses raisons de déplacer vos données de Spark vers R. Vous avez déjà vu qu'une partie des données est transférée de Spark à R lorsque vous les affichez. Vous devez aussi rapatrier votre jeu de données si vous voulez le visualiser ou utiliser une technique de modélisation qui n'est pas offerte dans Spark. (Après tout, R propose la plus vaste sélection de modèles parmi tous les langages de programmation.)

Pour rapatrier vos données — c'est-à-dire les déplacer de Spark vers R — vous appelez collect().

Cette activité fait partie du cours

Introduction à Spark avec sparklyr en R

Voir le cours

Instructions de l’exercice

Une connexion Spark a été créée pour vous sous le nom spark_conn. Un tibble lié aux métadonnées des pistes stockées dans Spark a été prédéfini sous le nom track_metadata_tbl.

  • Filtrez les lignes de track_metadata_tblartist_familiarity est supérieur à 0.9 et assignez le résultat à results.
  • Affichez la classe de results, en notant qu'il s'agit d'un tbl_lazy (utilisé pour les données distantes).
  • Rapatriez vos résultats avec collect() et assignez-les à collected.
  • Affichez la classe de collected, en notant qu'il s'agit d'un tbl_df (utilisé pour les données locales).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Modifier et exécuter le code