การโหลด dataframe จากไฟล์ parquet
ไฟล์ dataframe ชื่อ sherlock_sentences.parquet พร้อมใช้งานในพื้นที่ทำงานของคุณแล้ว แต่ละแถวของ dataframe นี้ประกอบด้วยอนุประโยคหนึ่งอนุประโยค โดยแต่ละอนุประโยคคือลำดับของคำที่คั่นด้วยเครื่องหมายวรรคตอน เช่น จุด เครื่องหมายคำพูด หรือตัวคั่นอื่น ๆ ในภาษาธรรมชาติที่ใช้ระบุประโยคหรือส่วนของประโยค ภารกิจของคุณคือโหลดไฟล์นี้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Introduction to Spark SQL in Python
คำแนะนำการฝึกหัด
- โหลด
sherlock_sentences.parquet - กรองข้อมูลด้วยเงื่อนไข "id > 70" แล้วแสดง 5 แถวแรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)