การแยกวิเคราะห์ไฟล์ PDF
ตอนนี้ถึงเวลาจัดการกับโปรเจกต์เล็กๆ ที่ค้างอยู่แล้ว บริษัทมอบไฟล์ PDF สัญญาที่ลงนามแล้วให้คุณหลายฉบับ เป้าหมายของโปรเจกต์คือสร้างฐานข้อมูลจากข้อมูลที่แยกวิเคราะห์ได้ โดยต้องมี 3 คอลัมน์สำหรับวัน เดือน และปีที่ลงนามสัญญา
วันที่ในเอกสารปรากฏในรูปแบบ Signed on 05/24/2016 (โดย 05 คือเดือน และ 24 คือวัน) จึงใช้ capturing groups เพื่อดึงข้อมูลส่วนนี้ออกมา และจัดเก็บแต่ละค่าไว้ในตัวแปรแยกกัน
ลองทำ proof of concept ดูก่อน
ตัวแปร contract ที่เก็บข้อความของสัญญาฉบับหนึ่ง และโมดูล re ถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print() เพื่อดูข้อมูลใน IPython Shell ได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Regular Expressions ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)