НачатьНачать бесплатно

Извлечение текста с помощью PyPDF

PyPDF позволяет извлекать текст из PDF-файлов, что упрощает работу с многостраничными документами — например, с файлами корпоративных политик.

В этом упражнении вы загрузите файл US_Employee_Policy.pdf, извлечёте его содержимое постранично и объедините всё в одну строку, подготовив текст для передачи в конвейер вопросно-ответной обработки.

Это упражнение является частью курса

Работа с Hugging Face

Посмотреть курс

Инструкции к упражнению

  • Импортируйте необходимый класс из pypdf и используйте его для загрузки PDF-файла.
  • Получите доступ к каждой странице и извлеките её содержимое с помощью соответствующего метода.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Редактировать и запускать код