Wyodrębnianie tekstu za pomocą PyPDF
PyPDF umożliwia wyodrębnianie tekstu z plików PDF, co ułatwia pracę z wielostronicowymi dokumentami, takimi jak regulaminy.
W tym ćwiczeniu wczytasz plik US_Employee_Policy.pdf, wyodrębnisz jego zawartość strona po stronie i połączysz ją w jeden ciąg znaków – przygotowując tekst do użycia w potoku pytań i odpowiedzi.
To ćwiczenie jest częścią kursu
Praca z Hugging Face
Instrukcje do ćwiczenia
- Zaimportuj wymaganą klasę z
pypdfi użyj jej do wczytania pliku PDF. - Przejdź przez kolejne strony i wyodrębnij ich zawartość, korzystając z odpowiedniej metody.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)