英文原标题:Deploy Hugging Face models on Amazon SageMaker AI with coding agents

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 文章介绍如何用编码代理(如Kiro和Claude Code)在Amazon SageMaker AI上部署Hugging Face模型,通过安装Hugging Face Skills中的六个技能,实现生产级部署。
  • 无引导的编码代理容易出错:测试中代理首选TGI容器,但该容器无法加载Qwen3模型,导致健康检查失败和GPU资源浪费;对于新发布的多模态MoE扩散模型,代理也错误地选择了TGI。
  • 根本原因是代理缺乏最新的部署知识,如新模型需要vLLM、Python 3.13缺少ML栈的wheel、容器镜像应从AWS DLC目录解析等,这些知识变化快,因此被做成可编辑的技能文件。
  • 六个技能包括规划器、AWS上下文发现、Python环境设置、IAM预检、服务镜像选择和生产默认值,规划器协调其他五个,覆盖端到端部署流程。
  • 技能是开源、仅用Python和AWS CLI,跨平台,支持实时端点、scale-to-zero、无服务器推理、异步推理、批量转换和Amazon Bedrock自定义模型导入。

关键数据

  • 六个技能来自Hugging Face Skills GitHub仓库
  • 测试中代理首次选择TGI导致健康检查失败,后改用vLLM
  • 技能默认使用Boto3和AWS CLI,而非SageMaker Python SDK
  • 部署涉及五个AWS服务:SageMaker AI、IAM、ECR、AWS DLC、CloudWatch

引语

  • 部署Hugging Face模型到生产环境意味着要做十几个决定
  • 无引导的编码代理可能会做出错误决定,产生脆弱、昂贵或悄悄错误的端点

为什么值得看:本文展示了如何通过结构化技能让编码代理可靠地完成复杂的模型部署,避免常见错误和资源浪费。

站内导航