เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ตัดขั้นตอนที่ไม่จำเป็นออก

ตอนนี้รู้แล้วว่าจะนำข้อมูลเข้า Spark ผ่าน pandas ได้อย่างไร แต่คงสงสัยว่าทำไมต้องผ่าน pandas ด้วย? การอ่านไฟล์ข้อความเข้า Spark โดยตรงนั้นสะดวกกว่าไหม? แน่นอนว่าสะดวกกว่า!

โชคดีที่ SparkSession มี attribute ชื่อ .read ซึ่งมีเมธอดหลายตัวสำหรับอ่านข้อมูลจากแหล่งต่าง ๆ เข้าเป็น Spark DataFrame ด้วยวิธีนี้ สามารถสร้าง DataFrame จากไฟล์ .csv ได้เลย เหมือนกับที่ทำใน pandas!

ตัวแปร file_path เป็น string ที่เก็บพาธของไฟล์ airports.csv ซึ่งมีข้อมูลเกี่ยวกับสนามบินต่าง ๆ ทั่วโลก

มี SparkSession ชื่อ spark พร้อมใช้งานใน workspace แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้เมธอด .read.csv() เพื่อสร้าง Spark DataFrame ชื่อ airports
    • อาร์กิวเมนต์แรกคือ file_path
    • ส่งอาร์กิวเมนต์ header=True เพื่อให้ Spark รู้ว่าต้องดึงชื่อคอลัมน์จากบรรทัดแรกของไฟล์
  • แสดงผล DataFrame นี้ด้วยการเรียก .show()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
แก้ไขและรันโค้ด