Načítání dat v prostředí PySpark shellu
V PySparku vyjadřujeme výpočty prostřednictvím operací nad distribuovanými kolekcemi, které jsou automaticky paralelizovány napříč clusterem. V předchozím cvičení jsi viděl/a příklad načtení seznamu jako paralelizované kolekce – v tomto cvičení načteš data z lokálního souboru v prostředí PySpark shellu.
Pamatuj, že ve svém pracovním prostoru máš k dispozici SparkContext sc a proměnnou file_path (která obsahuje cestu k souboru README.md).
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Načti lokální textový soubor
README.mdv prostředí PySpark shellu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load a local file into PySpark shell
lines = sc.____(file_path)