CommencezCommencez gratuitement

Utilisation interactive de PySpark

Spark est fourni avec un interpréteur Python interactif dans lequel PySpark est déjà installé. La coquille PySpark est utile pour les tests de base et le débogage, et elle est assez puissante. La façon la plus simple de démontrer la puissance de la coquille de PySpark, c'est avec un exercice. Dans cet exercice, vous allez charger, dans la coquille PySpark, une simple liste contenant des nombres de 1 à 100.

L'élément le plus important à retenir ici, c'est que nous ne créons aucun objet SparkContext, puisque PySpark crée automatiquement l'objet SparkContext nommé sc dans la coquille PySpark.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez une liste Python nommée numb contenant les nombres de 1 à 100.
  • Chargez la liste dans Spark en utilisant la méthode parallelize de Spark Context et affectez le résultat à une variable spark_data.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a Python list of numbers from 1 to 100 
numb = range(____, ____)

# Load the list into PySpark  
spark_data = sc.____(numb)
Modifier et exécuter le code