ÎncepețiÎncepe gratuit

Încărcarea fișierelor HTML pentru RAG

Documentele pot fi încărcate din multe formate diferite, inclusiv formate mai complexe precum HTML.

Dacă nu ești familiarizat cu HTML, acesta este un limbaj de marcare folosit pentru crearea paginilor web. Iată un exemplu simplu:

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

În acest exercițiu, vei încărca un fișier HTML care conține o pagină de blog de pe DataCamp. Clasele necesare au fost deja importate pentru tine.

Acest exercițiu face parte din cursul

Retrieval Augmented Generation (RAG) cu LangChain

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește clasa UnstructuredHTMLLoader pentru a încărca fișierul datacamp-blog.html din directorul curent.
  • Încarcă documentele în memorie.
  • Afișează conținutul paginii pentru primul document.
  • Afișează metadatele primului document.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
Editează și rulează codul