阿里云栖大会公布面向Agent的智能价值衡量体系
2026年AI产业的竞争重点正从模型发布转向业务落地。阿里巴巴战略副总裁、ATH事业群MaaS业务线总裁文征提出“智能价值密度”公式:单任务价值×Token生产效率×Token单位能力,认为衡量AI不能只看Token消耗,更要看其转化出的生产力。
千问AI平台过去不到一年客户数增长6倍,服务范围也从模型和算力扩展到芯片、云资源、Agent、AI应用及行业方案,形成覆盖底层模型服务、中间层Agent平台和上层行业解决方案的供给体系。
面向Agent的“开机风暴”,平台针对短时高并发、长上下文、多轮调用和7×24小时运行等新型负载进行升级。自2025年9月Qwen3 Max以来,旗舰语言模型一年迭代五代,并覆盖语言、图像、视频、音乐、音频及端云不同规格,同时接入DeepSeek、Kimi、GLM、MiniMax等开放模型。
在基础设施方面,FlashBoot把模型弹性启动时间从1200秒降至70秒,UniScheduler将集群调度耗时从20秒降至0.4秒;推理优化使首Token延迟降低38%,峰值吞吐提升至原来的两倍。Vineyard分布式全局KV缓存支持显式和隐式缓存,Prompt caching成本最高可节省95%。
平台还提供99.9%服务SLA、AutoTPM自动容量管理、业务空间隔离及最长3600秒超时设置。CMaaS机密推理结合加密与审计,接入层覆盖身份、权限、提示词注入防护和内容安全,监控则覆盖时延、错误率、容量与预算。
服务模式包括免费额度、按量付费、Token Plan、吞吐预留PTU、独占吞吐DTU和定制部署。API优速模式Prime的Token生成速度约为标速的1.5至2倍;PTU新增标速、高速和8小时选项,Token Plan则支持多模型、多Agent工具及团队统一订阅管理。
平台同时推出生产级Agent服务平台Agent Studio,覆盖开发、运行、上下文、工具、评测进化和安全六个环节,支持CLI、工作流、托管环境、沙箱、知识库、长期记忆、MCP、Skill及Connector。其能力包括7×24小时运行、断点续传、错误自恢复、模型路由和安全防护。
Agent Studio还将运行观测、AI评测、自动优化和小流量验证串联起来,帮助企业持续改进Agent。平台承担的是模型调用、工程运维和治理等共性负担,任务验收、权限边界、异常升级及人工接管仍需由企业负责,目标是把可调用的智能转化为可运行、可托管的生产任务。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文