RAG のための HTML ファイル読み込み
HTML のような複雑な形式を含め、さまざまなフォーマットからドキュメントを読み込むことができます。
HTMLに慣れていない方のために説明すると、HTMLはウェブページを作成するためのマークアップ言語です。小さな例を示します。
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
この演習では、DataCamp のブログ記事ページを含む HTML ファイルを読み込みます。必要なクラスはすでにインポートされています。
この演習はコースの一部です
LangChain で学ぶ Retrieval Augmented Generation (RAG)
演習の手順
- 現在のディレクトリにある
datacamp-blog.htmlファイルを読み込むために、UnstructuredHTMLLoaderクラスを使います。 - ドキュメントをメモリに読み込みます。
- 最初のドキュメントのページコンテンツを出力します。
- 最初のドキュメントのメタデータを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)