or
この演習はコースの一部です
Hugging Face のモデルハブを探索し、生のテキスト・音声・画像データを AI が扱いやすい形式に変換します。テキスト生成などのタスクで、最新かつ人気のモデルを見つける方法を学び、事前構築されたパイプラインの力を活用しましょう。
最先端モデルで各モダリティを個別に極めます。画像分類やセグメンテーションなどのコンピュータビジョンを深掘りし、音声認識やテキスト読み上げ合成を体験、効果的なファインチューニング手法も学びます。Hugging Face の transformers ライブラリの事前学習モデルで、実践的なスキルを身につけましょう。
視覚・テキスト・音声情報を融合し、よりリッチな AI アプリケーションを作りましょう。CLIP によるゼロショット分類などの手法をマスターし、見る+読むを組み合わせた感情分析器や、表情と声を統合した感情検出器を構築します。単一モーダルの枠を超えた AI モデルを目指します。
アイデアを形にしましょう。テキストプロンプトから視覚コンテンツを生成・編集する最先端の AI 技術を身につけます。魅力的な画像の生成、写真のインテリジェントな編集、画像や文書に対する強力な質問応答システムの構築に取り組みます。マルチモーダル AI で、あなたの創造力をデジタルで実現しましょう。
現在の演習