Интерактивная работа с PySpark
Spark поставляется с интерактивной оболочкой Python, в которой уже установлен PySpark. Оболочка PySpark удобна для базового тестирования и отладки и обладает широкими возможностями. Лучший способ убедиться в этом — сразу перейти к практике. В этом упражнении вы загрузите в оболочку PySpark простой список чисел от 1 до 100.
Важно понимать, что создавать объект SparkContext вручную не нужно: PySpark автоматически создаёт его под именем sc при запуске оболочки.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте список Python с именем
numb, содержащий числа от 1 до 100. - Загрузите список в Spark с помощью метода
parallelizeобъекта SparkContext и присвойте результат переменнойspark_data.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a Python list of numbers from 1 to 100
numb = range(____, ____)
# Load the list into PySpark
spark_data = sc.____(numb)