การจัดกลุ่มข้อมูลด้วย pandas
ผลลัพธ์ของ data pipeline มักอยู่ในรูปแบบชุดข้อมูลที่ผ่านการจัดโครงสร้างแล้ว ซึ่งช่วยให้ผู้ใช้ข้อมูลเข้าถึงสารสนเทศได้สะดวก โดยไม่ต้องปรับแต่งข้อมูลมากนัก การจัดกลุ่มข้อมูลด้วย pandas ช่วยให้สร้างชุดข้อมูลในรูปแบบนี้ได้อย่างมีประสิทธิภาพ
pandas ถูก import มาในชื่อ pd และ DataFrame raw_testing_scores มีข้อมูลในรูปแบบดังนี้:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ETL และ ELT ด้วย Python
คำแนะนำการฝึกหัด
- ใช้
.loc[]เพื่อเก็บเฉพาะคอลัมน์"city","math_score","reading_score"และ"writing_score" - จัดกลุ่ม DataFrame ตามคอลัมน์
"city"แล้วหาค่าเฉลี่ยของคะแนนคณิตศาสตร์ การอ่าน และการเขียนของแต่ละเมือง - ใช้ฟังก์ชัน
transform()เพื่อสร้าง DataFrame ที่จัดกลุ่มแล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())