Zacznij terazZacznij za darmo

Wczytywanie plików HTML do RAG

Dokumenty można wczytywać z wielu różnych formatów – w tym z bardziej złożonych, takich jak HTML.

Jeśli nie znasz HTML-a, to język znaczników służący do tworzenia stron internetowych. Oto krótki przykład:

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

W tym ćwiczeniu wczytasz plik HTML zawierający stronę wpisu z bloga DataCamp. Niezbędne klasy zostały już zaimportowane.

To ćwiczenie jest częścią kursu

Retrieval Augmented Generation (RAG) z LangChain

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj klasy UnstructuredHTMLLoader, aby wczytać plik datacamp-blog.html z bieżącego katalogu.
  • Załaduj dokumenty do pamięci.
  • Wyświetl zawartość strony pierwszego dokumentu.
  • Wyświetl metadane pierwszego dokumentu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
Edytuj i uruchom kod