Začněte nyníZačněte zdarma

RDD z externích datových sad

PySpark umožňuje snadno vytvářet RDD ze souborů uložených na externích úložištích, jako jsou HDFS (Hadoop Distributed File System), Amazon S3 a další. Nejběžnějším způsobem je ale vytváření RDD ze souborů uložených v lokálním souborovém systému. Tato metoda přijme cestu k souboru a načte ho jako kolekci řádků. V tomto cvičení vytvoříš RDD z cesty (file_path) k souboru README.md, který je už k dispozici ve tvém pracovním prostředí.

Nezapomeň, že SparkContext sc máš v pracovním prostředí také připravený.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vypiš file_path v PySpark shellu.
  • Vytvoř RDD s názvem fileRDD z cesty file_path.
  • Vypiš typ vytvořeného fileRDD.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Upravit a spustit kód