中科类脑以算电协同提升Token生产效率
大模型推理进入规模化阶段后,数据中心的评价标准正从卡数、算力和PUE转向单位电力能产出多少高质量Token。成立九年的中科类脑提出“算电协同型Token工厂”,将芯片、模型、任务、存储、网络与电力纳入统一调度,目标是在满足质量、时延和稳定性的前提下,以更低成本持续交付有效Token。
其前台平台BitaHub可统一管理英伟达、昇腾等异构算力,聚合模型API和Token服务,并连接企业私有算力池与公共资源池。平台目前接入超过3000个算力节点,总规模逾5000P,累计服务超过8万家企业及科研用户;后台则由与中国科大团队联合研发的决策大脑,统筹算力、Token和电力三个子系统。相较于IDC和云厂商,中科类脑试图承担更上层的Token生产运营责任。
系统采用“1+3”架构,先监测Token需求、集群负载、新能源出力、电价及单位算力产出,再预测未来15分钟、1小时及更长时间的变化,最后执行调度。实时任务保持就地运行,可排队或可中断的批处理任务则能迁移至低价、绿电充足的时段和地点。公司还为不同芯片配置适配插件并建立能力画像,以提升异构协同效率。
在推理环节,Prefill与Decode可拆分处理,前者交给计算能力更强的芯片,后者交给显存和带宽更充足的芯片,并通过KV Cache迁移避免长上下文重复计算。一次覆盖上海、芜湖和乌鲁木齐的测试中,跨域调度控制响应低于200秒,迁移成功率为100%,能耗预测精度达98%,被称为全国首个跨三地算电协同智能调度测试。
9月17日,皖疆人工智能科技产业园在乌鲁木齐开园,按“三中心一平台”规划,首个超过千P的融合算力中心已投运。公司随后推出算电词元一体化平台,延续“1+3”架构。其长期目标是建设“黑灯工厂”,由算力智能体处理芯片适配、任务切分和KV Cache搬运,电力智能体预测电价与绿电并控制储能,未来进一步根据模型效率反推芯片设计。
面对Token价格下降,公司以“度电智能”作为优化指标:先通过异构调度和推理加速增加每度电的有效Token,再叠加电力协同降低单位成本,最终把通用Token组织成科研、能源等场景结果。我国日均Token调用量已从2024年初的1000亿增至2026年3月的140万亿,部分主流模型API累计降价超过90%。中科类脑2019年上线BitaHub,电力智能化业务已深耕七年多,覆盖十余省市、上百座变电站,2024年两条技术路线汇合。
公司判断,行业竞争正从算力、模型和API价格转向系统效率及场景结果,重点涉及每瓦Token产出、PD分离、KV Cache分层、异构芯片、端侧推理和算电协同。中移基金于2025年独家投资B轮,中车资本于2026年领投数亿元B+轮,银杏谷、水木、启迪等跟投。其核心壁垒被概括为长期稳定运营算力、电力、模型与任务的跨域系统能力。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文