Začněte nyníZačněte zdarma

Načítání dat v prostředí PySpark shellu

V PySparku vyjadřujeme výpočty prostřednictvím operací nad distribuovanými kolekcemi, které jsou automaticky paralelizovány napříč clusterem. V předchozím cvičení jsi viděl/a příklad načtení seznamu jako paralelizované kolekce – v tomto cvičení načteš data z lokálního souboru v prostředí PySpark shellu.

Pamatuj, že ve svém pracovním prostoru máš k dispozici SparkContext sc a proměnnou file_path (která obsahuje cestu k souboru README.md).

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti lokální textový soubor README.md v prostředí PySpark shellu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Upravit a spustit kód