AI 推理服务上线后,Kubernetes 不只是运行容器的平台,更是资源治理、流量治理和发布治理的核心底座。一个可靠的推理服务需要先明确模型镜像、运行时依赖、显存需求、并发能力和健康检查方式,再进入集群调度。
资源隔离
GPU/NPU 资源比普通 CPU 更稀缺,建议通过节点标签、污点容忍、ResourceQuota 和 LimitRange 把训练、推理、测试环境隔离开。推理服务还要根据模型大小设置显存上限、批处理参数和超时策略,避免单个服务占满整机资源。
服务暴露
线上访问通常会经过 Ingress、API 网关或服务网格。运维人员需要关注连接超时、请求体大小、流式响应、鉴权和限流策略。对于高并发推理,还要把模型服务、业务 API 和队列系统拆开,避免前端请求直接压垮推理实例。
弹性伸缩与发布
HPA 适合基于 CPU、内存或自定义指标扩缩容,KEDA 更适合结合队列长度触发扩缩容。发布时建议使用金丝雀或蓝绿发布,先让少量流量命中新模型,再观察延迟、错误率和答案质量。出现异常时,回滚策略必须能快速切回旧模型和旧配置。

