ตัดขั้นตอนที่ไม่จำเป็นออก
ตอนนี้รู้แล้วว่าจะนำข้อมูลเข้า Spark ผ่าน pandas ได้อย่างไร แต่คงสงสัยว่าทำไมต้องผ่าน pandas ด้วย? การอ่านไฟล์ข้อความเข้า Spark โดยตรงนั้นสะดวกกว่าไหม? แน่นอนว่าสะดวกกว่า!
โชคดีที่ SparkSession มี attribute ชื่อ .read ซึ่งมีเมธอดหลายตัวสำหรับอ่านข้อมูลจากแหล่งต่าง ๆ เข้าเป็น Spark DataFrame ด้วยวิธีนี้ สามารถสร้าง DataFrame จากไฟล์ .csv ได้เลย เหมือนกับที่ทำใน pandas!
ตัวแปร file_path เป็น string ที่เก็บพาธของไฟล์ airports.csv ซึ่งมีข้อมูลเกี่ยวกับสนามบินต่าง ๆ ทั่วโลก
มี SparkSession ชื่อ spark พร้อมใช้งานใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
คำแนะนำการฝึกหัด
- ใช้เมธอด
.read.csv()เพื่อสร้าง Spark DataFrame ชื่อairports- อาร์กิวเมนต์แรกคือ
file_path - ส่งอาร์กิวเมนต์
header=Trueเพื่อให้ Spark รู้ว่าต้องดึงชื่อคอลัมน์จากบรรทัดแรกของไฟล์
- อาร์กิวเมนต์แรกคือ
- แสดงผล DataFrame นี้ด้วยการเรียก
.show()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()