Utilisation interactive de PySpark
Spark est fourni avec un interpréteur Python interactif dans lequel PySpark est déjà installé. La coquille PySpark est utile pour les tests de base et le débogage, et elle est assez puissante. La façon la plus simple de démontrer la puissance de la coquille de PySpark, c'est avec un exercice. Dans cet exercice, vous allez charger, dans la coquille PySpark, une simple liste contenant des nombres de 1 à 100.
L'élément le plus important à retenir ici, c'est que nous ne créons aucun objet SparkContext, puisque PySpark crée automatiquement l'objet SparkContext nommé sc dans la coquille PySpark.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez une liste Python nommée
numbcontenant les nombres de 1 à 100. - Chargez la liste dans Spark en utilisant la méthode
parallelizede Spark Context et affectez le résultat à une variablespark_data.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a Python list of numbers from 1 to 100
numb = range(____, ____)
# Load the list into PySpark
spark_data = sc.____(numb)