RDD z externích datových sad
PySpark umožňuje snadno vytvářet RDD ze souborů uložených na externích úložištích, jako jsou HDFS (Hadoop Distributed File System), Amazon S3 a další. Nejběžnějším způsobem je ale vytváření RDD ze souborů uložených v lokálním souborovém systému. Tato metoda přijme cestu k souboru a načte ho jako kolekci řádků. V tomto cvičení vytvoříš RDD z cesty (file_path) k souboru README.md, který je už k dispozici ve tvém pracovním prostředí.
Nezapomeň, že SparkContext sc máš v pracovním prostředí také připravený.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vypiš
file_pathv PySpark shellu. - Vytvoř RDD s názvem
fileRDDz cestyfile_path. - Vypiš typ vytvořeného
fileRDD.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))