LayoutLM を使ったドキュメント VQA
画像の VQA からドキュメントの VQA へ!この演習では、layoutlm-document-qa モデルを使って、次のドキュメント画像から 2012~2013 年に従業員へ提供された研修時間の合計を特定します。

データセット(dataset)は読み込まれており、pipeline モジュール(pipeline)もインポート済みです。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
- タスクに
'document-question-answering'、チェックポイントに'impira/layoutlm-document-qa'を指定して pipeline を読み込みます。 datasetのtestセットのデータポイント61に含まれるドキュメントを、適切なプロンプトで処理して、2012~2013 年に従業員へ提供された正式な研修が何日間だったかを見つけてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the document-question-answering pipeline with the pretrained model
pipe = ____
# Process datapoint 61 to find the amount of training days
result = ____(dataset["____"][61]["____"], "____")
print(result)