เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเพิ่มฟิลด์ ID

เมื่อทำงานกับข้อมูล บางครั้งเราต้องการเข้าถึงเฉพาะบางฟิลด์และดำเนินการต่าง ๆ กับข้อมูลนั้น ในแบบฝึกหัดนี้ ให้ค้นหาชื่อผู้ลงคะแนนที่ไม่ซ้ำกันจาก DataFrame แล้วเพิ่มหมายเลข ID ที่ไม่ซ้ำกันให้แต่ละรายการ โปรดทราบว่า ID ใน Spark จะถูกกำหนดตาม partition ของ DataFrame ดังนั้นค่า ID อาจมากกว่าจำนวนแถวจริงใน DataFrame

เนื่องจาก Spark ใช้การประมวลผลแบบ lazy ID จะยังไม่ถูกสร้างจริงจนกว่าจะมีการ action และค่าที่ได้อาจแปรผันตามขนาดของชุดข้อมูล

ในพื้นที่ทำงานมี session spark และ Spark DataFrame df ที่โหลดไฟล์ DallasCouncilVotes.csv.gz ไว้แล้ว รวมถึงไลบรารี pyspark.sql.functions ที่ import ไว้ภายใต้ชื่อย่อ F

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลด้วย PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เลือกรายการที่ไม่ซ้ำกันจากคอลัมน์ VOTER NAME แล้วสร้าง DataFrame ใหม่ชื่อ voter_df
  • นับจำนวนแถวใน DataFrame voter_df
  • เพิ่มคอลัมน์ ROW_ID โดยใช้ฟังก์ชัน Spark ที่เหมาะสม
  • แสดงแถวที่มี ROW_ID สูงสุด 10 อันดับแรก

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
แก้ไขและรันโค้ด