Charger des données dans l'interpréteur PySpark
En PySpark, on exprime le calcul au moyen d'opérations sur des collections distribuées, automatiquement parallélisées sur le cluster. Dans l'exercice précédent, vous avez vu comment charger une liste comme collection parallélisée. Dans cet exercice, vous allez charger des données à partir d'un fichier local dans l'interpréteur PySpark.
Rappel : vous disposez déjà d'un SparkContext sc et d'une variable file_path (le chemin vers le fichier README.md) dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Chargez le fichier texte local
README.mddans l'interpréteur PySpark.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load a local file into PySpark shell
lines = sc.____(file_path)