泡泡资讯网

Agent时代拼毫秒时延,原生液冷与多模融合重构AI算力架构

十年前,人们谈论 AI,谈的是算法、算力和数据三位一体的“炼丹术”;两年前,ChatGPT 横空出世,人们谈论大模型,谈

十年前,人们谈论 AI,谈的是算法、算力和数据三位一体的“炼丹术”;两年前,ChatGPT 横空出世,人们谈论大模型,谈的是参数量、Token 和 Scaling Law,一场关于“更大即更强”的军备竞赛。

就在2026年7月开放计算技术大会(OCTS 2026)现场,浪潮信息副总经理赵帅抛出了一个观点:AI应用的核心形态,正在从单次模型调用,走向海量智能体(Agent)的持续运行与协同执行。

这句话背后的潜台词是——支撑AI的底层基础设施逻辑,要被彻底推翻了。

过去两年,整个行业都在围绕一个核心叙事运转:更大的模型、更多的GPU、更快的训练速度。但2026年,当Agent开始像“数字员工”一样7×24小时在企业里跑起来,当多模型协同比单一模型更能打,算力基础设施面临的是一个完全不同的考题。

1、Agent“吃”的不仅是GPU,还有CPU

很多人对AI推理的印象还停留在“Prompt进去,Token出来”。但Agent的工作方式完全不同。

赵帅在采访中打了一个生动的比方:你问一个AI“暑假带老人去旅游,推荐个地方”。用传统大模型问答生成,它可能给你编一个根本不存在的车次,再规划一条日均两万步的“拉练路线”,幻觉率高得离谱。

但一个由33个Agent协同工作的系统会这么做:有的负责拆解需求,有的上网查实时车票和轮椅通道,有的规划每天不超过3000步的路线,最后还有Agent负责汇总成一份靠谱的攻略。

这个过程中,只有2个纯推理步骤由GPU主导,剩下的6个步骤——分支预测、信息查询、逻辑决策、任务编排等——全部跑在CPU上。

赵帅直言:“GPU决定了模型的智能上限,而多Agent则是用工程化手段拔高模型治理水平。”

换句话说,模型能力决定了你能做到多好,但Agent工程决定了你实际能输出多好。两者缺一不可。

这场转变带来的直接后果,是CPU与GPU的算力配比逻辑彻底变了。过去智算中心一直在堆GPU,但Agent爆发之后,CPU服务器算力资源如何提升成为大家关注的新方向。因为Agent的沙箱环境、逻辑管理、流程调度全部依赖通用计算,这些任务不挑GPU,但极其消耗CPU算力。

2、机柜逼近兆瓦:液冷还能怎么变?

当Agent从“临时工”变成7×24小时在线的“正式员工”,承载它们的物理底座必须进化。

第一个冲击是密度。浪潮信息在现场发布了一款“CPU原生液冷整机柜服务器”,参数极其硬核:0.5U的超薄空间里塞进4颗CPU,单机柜集成384颗处理器,支持4万+Agent并发运行。

这不仅仅是堆料。背后的物理瓶颈非常现实:传统风冷散热极限在单柜40-50千瓦,而Agent高密度部署后,AI机柜单柜功耗直接拉到300千瓦,海外AI机柜今年底将突破兆瓦级,空气在这个密度下已经完全失效,智算中心的电力基础设施会面向数百千瓦甚至MW级单柜进行重构。

空气在这个密度下已经完全失效。

赵帅在现场提到一个关键细节:传统380V供电方案的铜缆会粗到无法施工,800V高压直流进机柜成为必然选择。 浪潮信息的解决方案是“算电分离”——把电源模块从节点里独立出来,用Busbar(母线槽)直连供电,机柜内部实现100%全液冷覆盖,甚至支持“带液热维护、业务零中断”。

但液冷本身也有“真假”之分。行业内过去的主流做法,是在传统风冷服务器上给CPU和GPU加一块冷板,风扇照转、风道照留、线缆照走。这种“风冷架构+液冷部件”的“打补丁”式演进,虽然能缓解局部散热压力,却无法突破系统密度、能源效率和运维复杂度这三重天花板。风扇还在转,风道还在占空间,液路还在绕来绕去,你只是在风冷的骨架上贴了一块液冷的膏药。

浪潮信息在大会上提出的“原生液冷”,和传统“贴膏药”的风液混合散热完全是两码事。

它的核心理念只有一句话:计算与散热协同设计,而不是让液冷去适配计算。

这意味着,CPU、GPU、内存、SSD、网卡——所有发热部件从设计之初就围绕液冷重新布局。传统服务器要考虑前后风道,而原生液冷直接取消了风道,节点可以前后双侧维护,计算、交换、供电模块立体化部署,空间利用率大幅提升。冷板也不再是简单的单面贴片,而是采用双面散热和优化流道设计,让单位面积散热能力跟上芯片功耗的疯涨。

另外,原生液冷更加注重标准化和模块化设计。围绕计算模组、智算模组、交换模组等构建统一的Building Blocks(基础模块),形成可复用、可扩展、可组合的开放架构,为不同规模、不同场景的AI基础设施提供统一设计基础。这种模块化理念不仅有助于提升产业链协同效率,也为开放计算生态的发展提供了重要支撑。

当风冷时代形成的部件形态约束被彻底打破,机柜密度才有了真正意义上的跃迁。这也是为什么单柜384颗CPU这件事能成为现实——不是靠堆,而是靠从零开始重构整个系统的散热逻辑。

赵帅在现场做了一个判断:未来AI基础设施的竞争,不再是谁的冷板散热能力更强,而是谁的计算密度、能源效率、系统可靠性和全生命周期运维能力的综合胜出。 原生液冷,正是在为这场综合竞争打地基。

3、“多模融合”走上牌桌:4.77毫秒的Token战争

解决完Agent的“手脚”问题,还得解决它的“大脑”问题。

浪潮信息去年发布过一款“元脑 SD200超节点”,当时能做的是在一个系统里塞进数个万亿参数大模型。彼时外界觉得有点超前,但到了2026年,这个概念变成了刚需——“多模融合”正在成为提升模型输出质量的有效手段。

什么叫多模融合?简单说,就是一次API调用,把任务并行分发给多个候选模型,再由一个评审模型做共识提炼、差异识别、结果融合,最终输出一个更完整、更可靠的答案。

效果如何?在深度研究测试中,融合模型以53.9%的成绩领先所有单一模型;在AIME 2026数学推理和GPQA Diamond高难问答两项国际权威测试中,融合模型分别拿下97.2%和90.8%的全面领先。数据说明:多模型协同不是“花架子”,它确实比单一模型更能打。

但这对基础设施提出了全新需求:每一次调用背后都是多个模型并行推理、评审、融合,而且是海量Agent同时发起。这要求单机必须具备TB级统一显存、毫秒级超低延迟、高带宽互联。

元脑 SD200经过优化,将Kimi K2.6模型的单Token生成时间从8.9毫秒压到了4.77毫秒,成为国内首个突破5毫秒大关的超节点产品。与此同时,浪潮信息还推出了元脑SD200超节点企业版——16卡互联、TB级显存,能把万亿参数模型的首字延迟(TTFT)降低40%以上,降低企业部署和应用门槛。

4、“群体智能”的开端:AI进入工业化时代

整场采访下来,赵帅一直在传递一个抽象但至关重要的概念:群体智能的开端。这个概念有三层意思:

第一,算力分工明确。 GPU超节点负责“思考”——源源不断生产高吞吐Token;CPU Agent主机负责“行动”——让成千上万Agent有序协作、编排调度、沙箱运行。一个管脑力,一个管体力。

第二,模型各司其职。 不是所有任务都扔给万亿大模型。OCR识别交给小模型,复杂代码生成交给大模型,长上下文推理交给融合模型——通过智能路由按需调度,把Token成本控制在可控范围内。

第三,系统级协同大于单一能力。 正如赵帅在演讲结尾所说:“当算力分工明确,模型各司其职,Agent群体协同,AI就不仅仅是一个更聪明的模型,而是一个会协作的智能系统——这就是群体智能的开端。 ”

从风冷到原生液冷,从单一模型到多模融合,从单次调用到Agent集群,这场变革的本质是一道清晰的分水岭:AI正在从模型能力竞赛走向系统级协同的工业化时代。 这个时代的基础设施,不再是为了一颗芯片的峰值性能而建,而是为了成百上千个Agent的长期稳定运行而建。

这或许才是AI进入千行百业的正确姿势——不是靠一个万能大模型解决所有问题,而是靠一套会分工、会协作的智能系统,像生产线一样高效运转。

AI的“下半场”,算力架构革新已经悄悄开始了。