Încărcarea datelor în shell-ul PySpark
În PySpark, calculele sunt exprimate prin operații pe colecții distribuite, care sunt paralelizate automat în cadrul clusterului. În exercițiul anterior, ai văzut un exemplu de încărcare a unei liste ca și colecție paralelizată. În acest exercițiu, vei încărca date dintr-un fișier local în shell-ul PySpark.
Reține că ai deja un SparkContext sc și variabila file_path (care reprezintă calea către fișierul README.md) disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Încarcă fișierul text local
README.mdîn shell-ul PySpark.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load a local file into PySpark shell
lines = sc.____(file_path)