ПочатиПочніть безкоштовно

Завантаження HTML‑файлів для RAG

Документи можна завантажувати з багатьох різних форматів, зокрема з таких складних, як HTML.

Якщо ви не працювали з HTML, це мова розмітки для створення вебсторінок. Ось невеликий приклад:

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

У цій вправі ви завантажите HTML‑файл, що містить вебсторінку публікації блогу DataCamp. Необхідні класи вже імпортовано для вас.

Ця вправа є частиною курсу

Retrieval Augmented Generation (RAG) з LangChain

Переглянути курс

Інструкції до вправи

  • Використайте клас UnstructuredHTMLLoader, щоб завантажити файл datacamp-blog.html у поточному каталозі.
  • Завантажте документи в памʼять.
  • Виведіть вміст сторінки першого документа.
  • Виведіть метадані першого документа.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
Редагувати та запускати код