始める無料で始める

RAG用のHTMLファイルの読み込み

HTMLのような複雑な形式を含め、さまざまな形式のドキュメントを読み込むことができます。

馴染みがない方のために説明すると、HTMLとはウェブページを作成するためのマークアップ言語です。こちらが簡単な例です。

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

この演習では、DataCampのブログ記事のウェブページのためのHTMLファイルを読み込みましょう。必要なクラスはすでにインポート済みです。

この演習はコースの一部です

LangChainで学ぶ検索拡張生成(RAG)

コースを見る

演習の手順

  • UnstructuredHTMLLoaderクラスを使用して、現在のディレクトリにある datacamp-blog.htmlファイルを読み込んでください。
  • ドキュメントをメモリに読み込んでください。
  • 最初のドキュメントのページコンテンツを出力してください。
  • 最初のドキュメントのメタデータを出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
コードを編集して実行