เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

โหลดไฟล์ CSV เข้าสู่ DataFrame

ในแบบฝึกหัดก่อนหน้า คุณได้เห็นวิธีสร้าง DataFrame จาก RDD แล้ว โดยทั่วไป การโหลดข้อมูลจากไฟล์ CSV ถือเป็นวิธีที่นิยมใช้มากที่สุดในการสร้าง DataFrame ในแบบฝึกหัดนี้ คุณจะสร้าง PySpark DataFrame จากไฟล์ people.csv ที่เตรียมไว้ให้แล้วในรูปแบบตัวแปร file_path และตรวจสอบว่าออบเจกต์ที่สร้างขึ้นเป็น PySpark DataFrame

โปรดทราบว่า SparkSession ชื่อ spark และตัวแปร file_path (พาธของไฟล์ people.csv) พร้อมใช้งานใน workspace ของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง DataFrame จากตัวแปร file_path ซึ่งเป็นพาธของไฟล์ people.csv
  • ตรวจสอบผลลัพธ์ว่าเป็น PySpark DataFrame

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
แก้ไขและรันโค้ด