ÎncepețiÎncepe gratuit

Încărcarea unui fișier CSV într-un DataFrame

În exercițiul anterior, ai văzut o metodă de creare a unui DataFrame dintr-un RDD. În general, încărcarea datelor dintr-un fișier CSV este cea mai comună modalitate de a crea DataFrame-uri. În acest exercițiu, vei crea un DataFrame PySpark din fișierul people.csv, care îți este deja furnizat sub forma variabilei file_path, și vei confirma că obiectul creat este un DataFrame PySpark.

Reține că ai deja o sesiune SparkSession numită spark și o variabilă file_path (calea către fișierul people.csv) disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un DataFrame din variabila file_path, care reprezintă calea către fișierul people.csv.
  • Confirmă că rezultatul este un DataFrame PySpark.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Editează și rulează codul