เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้ DataFrame

ในแบบฝึกหัดที่แล้ว คุณได้เรียนรู้วิธีแบ่งงานและใช้ API ระดับล่างอย่าง multiprocessing.Pool ของ Python เพื่อทำการคำนวณบนหน่วยประมวลผลหลายตัวพร้อมกัน

การเข้าใจในระดับนี้เป็นสิ่งสำคัญ แต่ในทางปฏิบัติจริง เราแทบไม่ได้ใช้ API แบบนั้นโดยตรง วิธีที่สะดวกกว่าในการ parallelize การ apply บนหลาย group คือการใช้ framework dask และ DataFrame ที่เป็น abstraction ของ pandas

pandas DataFrame ชื่อ athlete_events พร้อมใช้งานใน workspace ของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Data Engineering เบื้องต้น

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

import dask.dataframe as dd

# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)
แก้ไขและรันโค้ด