โหลดไฟล์ CSV เข้าสู่ DataFrame
ในแบบฝึกหัดก่อนหน้า คุณได้เห็นวิธีสร้าง DataFrame จาก RDD แล้ว โดยทั่วไป การโหลดข้อมูลจากไฟล์ CSV ถือเป็นวิธีที่นิยมใช้มากที่สุดในการสร้าง DataFrame ในแบบฝึกหัดนี้ คุณจะสร้าง PySpark DataFrame จากไฟล์ people.csv ที่เตรียมไว้ให้แล้วในรูปแบบตัวแปร file_path และตรวจสอบว่าออบเจกต์ที่สร้างขึ้นเป็น PySpark DataFrame
โปรดทราบว่า SparkSession ชื่อ spark และตัวแปร file_path (พาธของไฟล์ people.csv) พร้อมใช้งานใน workspace ของคุณแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- สร้าง DataFrame จากตัวแปร
file_pathซึ่งเป็นพาธของไฟล์people.csv - ตรวจสอบผลลัพธ์ว่าเป็น PySpark DataFrame
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))