桃子桃子快讯
返回首页
产品功能

AWS SageMaker HyperPod 集成 Ray,简化分布式训练与部署

AWS 在 SageMaker HyperPod 推出 Ray 集成能力,可在 Studio 中直接创建 Ray 集群、…

2026.08.25 · 周二4 分钟阅读

AWS 在其面向基础模型训练与推理的专用基础设施 SageMaker HyperPod 上,正式推出与开源分布式计算框架 Ray 的深度集成。数据科学家无需再手动编写 Kubernetes YAML 清单或维护 Docker 镜像,即可在 SageMaker Studio 界面内一键创建 Ray 集群、打开 Ray Dashboard 与 Amazon Managed Grafana 可观测性面板,并将 JupyterLab 或 Code Editor 工作区挂载到集群上进行交互式开发、提交分布式训练与推理作业。

面向数据科学员的统一开发体验

新版本在 SageMaker Studio 的 HyperPod 任务面板中加入了 RayCluster 任务类型。用户填写集群名称、head 与 worker 节点实例类型、worker 数量以及容器镜像后即可创建集群,默认使用预装 Ray 并由 AWS 持续打补丁的 SageMaker Distribution 镜像,也支持自定义容器。对于需要深度定制的用户,Studio 内置的内联 YAML 编辑器可直接查看和修改完整的 Kubernetes 清单。

集群进入运行状态后,用户可以从「Actions」菜单直接打开 Ray Dashboard——该链接使用 IAM 短期凭证鉴权,仅对集群创建者可见,无需本地 kubectl 端口转发即可远程访问集群健康、运行作业与节点状态等关键信息。

远程作业提交与交互式开发

针对生产环境,AWS 提供了 Python 包 toolkit-for-ray-on-sagemaker-ai,配合 IAM 鉴权的 EKS API 凭证解析器,让用户既能在 Studio、笔记本或 CI/CD 流水线中提交远程作业,也能复用 Ray 标准的 ray job submit 接口:

  • 通过 aws eks update-kubeconfig 更新本地 kubeconfig;
  • 执行 pip install toolkit-for-ray-on-sagemaker-ai 安装客户端;
  • 使用 ray job submit --address sagemaker_ray://<cluster>/<namespace> 提交任务;
  • 通过 ray job list 查看任务列表。

在交互式开发方面,HyperPod 的 JupyterLab 或 Code Editor Space 可以直接挂载到 Ray 集群上,数据科学家可在熟悉的 Notebook 环境中调试分布式代码,而无需切换工具链。

训练容错与长上下文推理

在应用层,本次集成带来三项与基础模型密切相关的能力:

  • 自动容错:Ray 训练任务通过 HyperPod 的节点健康监控与自动恢复机制获得故障转移能力;
  • 分级检查点:借助 HyperPod 的分布式分级存储,模型检查点可被保存到更快且更具成本效益的存储层,从而缩短中断后的恢复时间;
  • 长上下文服务:SageMaker JumpStart 可直接将模型权重加载到 Ray Serve 端点,并通过分级存储卸载 KV cache,以支持长上下文推理请求。

兼容开源生态

整套能力建立在开源 KubeRay operator 与标准 Ray API 之上,因此现有的 Ray 脚本与工作流无需修改即可运行。AWS 也在 HyperPod 任务治理中纳入了对 Ray 工作负载的配额与调度优先级管理,使管理员能够将 Ray 作业与其他训练任务统一调度。

整体来看,这是 SageMaker HyperPod 在「降低分布式 ML 基础设施运维门槛」方向上的又一次重要补全,对于已经在使用 AWS 进行基础模型训练或推理的团队而言,可以减少大量底层 Kubernetes 与可观测性配置工作。

信源