到目前为止,您已经清楚,ML 应用远不止模型本身,且每个组件都有可能成为故障点。
因此,构建一套全面的监控系统至关重要,这能让您在生产环境中快速捕获并解决问题。
这样的系统应具备哪些基本特性?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
本章概述与部署和生命周期管理相关的 MLOps 原则与关键框架组件。
本章聚焦于在开发阶段就需要考虑的各类要点,以确保进入运维阶段时过程顺畅。 我们的终极目标是讲解如何按照 MLOps 最佳实践训练模型,并构建支持顺利部署、可复现以及部署后可监控的模型包。
本章将讨论模型运维中的关键问题,例如: - 我们可以通过哪些不同方式来提供模型服务? - 什么是 API?它的核心功能有哪些? - 在对外提供服务之前,如何对服务进行充分测试? - 如何在不影响服务的情况下更新生产环境中的模型? 您将学习批量预测、实时预测、输入与输出数据验证、单元测试、集成测试、金丝雀部署等内容。
最后一章将聚焦于模型服务部署后的监控与维护,以及模型治理。 您将学习到验证延迟、协变量偏移、概念漂移、人参与环系统等关键概念。
当前练习