Zacznij terazZacznij za darmo

Wyodrębnianie tekstu za pomocą PyPDF

PyPDF umożliwia wyodrębnianie tekstu z plików PDF, co ułatwia pracę z wielostronicowymi dokumentami, takimi jak regulaminy.

W tym ćwiczeniu wczytasz plik US_Employee_Policy.pdf, wyodrębnisz jego zawartość strona po stronie i połączysz ją w jeden ciąg znaków – przygotowując tekst do użycia w potoku pytań i odpowiedzi.

To ćwiczenie jest częścią kursu

Praca z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj wymaganą klasę z pypdf i użyj jej do wczytania pliku PDF.
  • Przejdź przez kolejne strony i wyodrębnij ich zawartość, korzystając z odpowiedniej metody.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Edytuj i uruchom kod