Wczytywanie plików HTML do RAG
Dokumenty można wczytywać z wielu różnych formatów – w tym z bardziej złożonych, takich jak HTML.
Jeśli nie znasz HTML-a, to język znaczników służący do tworzenia stron internetowych. Oto krótki przykład:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
W tym ćwiczeniu wczytasz plik HTML zawierający stronę wpisu z bloga DataCamp. Niezbędne klasy zostały już zaimportowane.
To ćwiczenie jest częścią kursu
Retrieval Augmented Generation (RAG) z LangChain
Instrukcje do ćwiczenia
- Użyj klasy
UnstructuredHTMLLoader, aby wczytać plikdatacamp-blog.htmlz bieżącego katalogu. - Załaduj dokumenty do pamięci.
- Wyświetl zawartość strony pierwszego dokumentu.
- Wyświetl metadane pierwszego dokumentu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)