微软推出开源 TauGrid 统一调度 Kubernetes GPU 任务
微软开源了 TauGrid,这是一套面向搭载 GPU 的 Kubernetes 集群的云原生 AI 工作负载平台,提供任务管理、资源调度和运行监控能力,覆盖从数据准备、分布式训练、模型微调到推理的完整流程。平台采用队列与拓扑感知调度机制,面向高强度 GPU 任务优化资源使用。
在常见方案中,平台团队需要自行组合多个开源项目,并维护提交脚本、队列封装、健康检查和结果检索等集成代码。TauGrid 通过工作区、队列、计算配置、存储、身份认证和可观测性等抽象,统一服务工程团队;研究人员则可借助命令行提交任务,无需直接掌握 Kubernetes。
TauGrid 集成了负责排队和资源管理的 Kueue、用于工作负载编排的 KubeRay、GPU 节点健康监控及可观测性功能,所有组件可通过一次 Helm 安装完成部署。用户使用 YAML 描述任务,再通过 tau run 提交;命令会校验配置并创建 Kubernetes Job 或 KubeRay RayJob,随后由 Kueue 按剩余配额和优先级排队。运行期间,平台会跟踪状态、日志与检查点,保存实验记录,便于复现实验和故障诊断,失败任务也可以从检查点恢复。
官方示例是在单个 A100 GPU 上运行 PyTorch 训练任务,配置包含 1 个 worker、16 个 CPU、64Gi 内存和 train.py 入口,运行时使用 mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0 镜像,并安装 torch 2.4.0。
TauGrid 仍处于开发阶段,后续计划加入多租户工作区、RBAC 与配额、PyTorch DDP/FSDP、DeepSpeed、LoRA/QLoRA、数据集生命周期管理以及多集群和多云执行。项目主要以 Go 编写,并在 Azure 生态中以开源方式进行开发和贡献。运行环境需要配备 GPU 节点的 Kubernetes 1.30 或更高版本集群、kubectl 和 Helm 3.0 及以上版本。类似平台还包括 Kubeflow 和 Nvidia Run:AI。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文