ПочатиПочніть безкоштовно

Видобування тексту за допомогою PyPDF

PyPDF дає змогу видобувати текст із PDF, що спрощує роботу з багатосторінковими документами, як-от файлові політики.

У цій вправі ви завантажите US_Employee_Policy.pdf, по сторінках видобудете його вміст і обʼєднаєте все в один рядок, щоб підготувати текст для конвеєра запитань і відповідей.

Ця вправа є частиною курсу

Робота з Hugging Face

Переглянути курс

Інструкції до вправи

  • Імпортуйте потрібний клас із pypdf і використайте його, щоб завантажити PDF-файл.
  • Доступайтеся до кожної сторінки та видобувайте її вміст за допомогою відповідного методу.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Редагувати та запускати код