ÎncepețiÎncepe gratuit

Încărcarea datelor în shell-ul PySpark

În PySpark, calculele sunt exprimate prin operații pe colecții distribuite, care sunt paralelizate automat în cadrul clusterului. În exercițiul anterior, ai văzut un exemplu de încărcare a unei liste ca și colecție paralelizată. În acest exercițiu, vei încărca date dintr-un fișier local în shell-ul PySpark.

Reține că ai deja un SparkContext sc și variabila file_path (care reprezintă calea către fișierul README.md) disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă fișierul text local README.md în shell-ul PySpark.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Editează și rulează codul