Încărcarea unui fișier CSV într-un DataFrame
În exercițiul anterior, ai văzut o metodă de creare a unui DataFrame dintr-un RDD. În general, încărcarea datelor dintr-un fișier CSV este cea mai comună modalitate de a crea DataFrame-uri. În acest exercițiu, vei crea un DataFrame PySpark din fișierul people.csv, care îți este deja furnizat sub forma variabilei file_path, și vei confirma că obiectul creat este un DataFrame PySpark.
Reține că ai deja o sesiune SparkSession numită spark și o variabilă file_path (calea către fișierul people.csv) disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Creează un DataFrame din variabila
file_path, care reprezintă calea către fișierulpeople.csv. - Confirmă că rezultatul este un DataFrame PySpark.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))