Видобування тексту за допомогою PyPDF
PyPDF дає змогу видобувати текст із PDF, що спрощує роботу з багатосторінковими документами, як-от файлові політики.
У цій вправі ви завантажите US_Employee_Policy.pdf, по сторінках видобудете його вміст і обʼєднаєте все в один рядок, щоб підготувати текст для конвеєра запитань і відповідей.
Ця вправа є частиною курсу
Робота з Hugging Face
Інструкції до вправи
- Імпортуйте потрібний клас із
pypdfі використайте його, щоб завантажити PDF-файл. - Доступайтеся до кожної сторінки та видобувайте її вміст за допомогою відповідного методу.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)