产品派
返回

英特尔白皮书聚焦机柜智能体交付能力

AIInfoQ 中文站2026/9/19 11:01:14
AI 导读

近几个月,Claude Fable 5.1、Gemini 3.8 Flash、GPT-6 Astra等新一代基础模型陆续发布,共同趋势是强化对Agent的支持,包括更长推理链、更顺畅的工具调用和更稳定的决策过程。随着企业采用加速,预计2026至2027年中国企业场景活跃Agent数量同比增速将超过200%,到2031年可能达到3.5亿个。

这一变化也让数据中心暴露出新的压力。传统基础设施更多围绕大模型单次推理吞吐设计,而Agent任务通常高频、突发、有状态,并伴随工具调用。谷歌调研显示,约83%的企业高管认为基础设施需要为Agent时代调整;AMD也提出CPU与GPU配比需要重估,AWS和NVIDIA则计划合作建设下一代AI基础设施。

英特尔在8月发布的白皮书中提出,衡量数据中心不应只看核心数、带宽、功耗内节点数量等理论指标,而应关注在满足延迟承诺时,单个机柜到底能稳定承载多少Agent任务。其核心观点是,计算实际可交付工作量,比追求理论性能上限更重要。英特尔还计划在9月22日至23日于苏州举行的2026年Intel Connection大会展示新的DCG产品及企业AI落地方案。

白皮书将一次Agent任务拆解后指出,模型调用约占总时间40%,主要运行在GPU上;其余约60%发生在主机端,主要由CPU承担。其中工具执行约占35%,数据服务如检索和向量搜索约占10%,KV缓存传输、TLS等状态搬运约占8%,编排调度约占7%。随着一个节点同时运行数百个沙箱,快照压缩、恢复解压、镜像内存分配等CPU密集任务会排队放大延迟。

一项针对739次匿名化Claude Code对话的测量显示,单请求场景下,主机端CPU在端到端延迟中的占比仅为0.4%至0.6%;当并发增至32个会话时,该比例升至11%至15%,其中约94%的增长来自调度和队列排队,而非实际计算。此时单个请求占用主机端CPU的时间超过单独运行时的20倍,GPU也会因SQL查询、沙箱测试、检索调用等环节而等待,编码Agent任务中GPU真正工作的时间估算仅为50%至60%。

为此,英特尔给出“每机柜可交付智能体数=理论每机柜智能体数×调度有效性×资源平衡度×计算卸载效益”的公式。调度有效性依赖对CPU、内存、I/O、加速器、缓存以及上下文和KV状态位置的采样,并结合至强的性能核、能效核和AMX等能力分配不同任务;资源平衡度则通过Flat Memory模式把CXL扩展内存与DDR5整合为统一地址空间。英特尔与SAP测试显示,该组合在大规模内存OLAP数据库中达到全DDR5性能的96%,内存成本降低25%。在计算卸载方面,至强内置QAT、DSA、IAA等加速引擎,IAA用于沙箱快照压缩后,恢复时延较不压缩方案降低38%至42%。白皮书举例称,理论容量高33%的机柜在综合这些因素后实际交付反而落后23%,说明Agent基础设施竞争将越来越依赖系统级效率。

智能体数据中心英特尔基础设施

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文