公司情报专家《财经涂鸦》获悉,9月22日,英特尔于在2026技术创新与产业生态大会上,展示了以CPU为中枢、面向智能体AI需求构建的全新智算中心。从CPU到GPU、IPU再到存储,这一架构贯穿了智能体AI运行所需的每一个环节。
英特尔数据中心集团副总裁、中国区总经理陈葆立在现场演讲中指出,数据中心的架构必须随智能体AI而变。一个智能体从思考到执行,牵动的是模型推理、任务编排、数据搬运与记忆管理的完整链路。因此,“全新的智算中心,应该以CPU为核心、CPU与GPU、IPU、存储协同运作,而不是单纯比拼某一环节的参数。”
以下为陈葆立演讲精编
AI智能体正在给大家、给社会带来更多新的机会。我们来看几组数字。
第一个数字是80%。预计到2026年底,超过80%的企业应用将至少嵌入一个AI智能体。中国大模型每天的Token调用量已增至2024年初的5000倍,而且还在持续增长。另一方面是基础设施投入,预计2026年全球AI优化型IaaS支出将增长96%。美银证券预计,到2029年,中国AI数据中心的固定资产投资规模将超过2.2万亿元人民币。
年初,全国都在安装“小龙虾”。到了暑期,大家都在装桌面型办公智能体软件。过去6个月,Harness也是一个流行词。最近,Loop engineering也开始兴起。
这一层又一层的软件机制,其中很多工作都比较适合CPU来执行。这也是为什么在过去一年时间里,AI智能体的兴起会带来对CPU的巨大需求
针对2030年CPU市场规模的预估,在短短半年里,从2026年2月预测的590亿美元,上调到了8月预测的2100亿美元,约为原来预测值的3.6倍。另外一个更重要的数据是,数据中心AI负载占比预计将从2025年的40%提升至2030年的80%。这意味着,未来整个数据中心的架构都会因为AI而发生改变和升级
我们把未来数据中心简单分为三类服务器或者集群。首先,要有CPU服务器/CPU集群,负责AI智能体执行和工作编排;中间是智算中心,或者说GPU服务器,配备AI加速卡,也即传统意义上的Token工厂。另外,它们会产生很多新的数据,因此还需要一个高性能存储集群。
这三类服务器或者集群有一个非常重要的共同点,就是都需要CPU来做数据调度
所以,当我们把Token工厂的概念升级到AI工厂时,讨论的就不止是这个Token工厂能产生多少Token,而是整个AI大系统如何以更低的资源消耗、更高的效率,完成更多工作。这是一种以任务为导向的思维,也是一个完全不同的想法。
先展开讲讲我们在CPU上的想法。今年6月,我们发布了全新英特尔至强6+处理器,采用Intel 18A制程,拥有业界领先的288个内核。同期,我们也宣布推出相应的智能体套件,能够在单颗288核至强处理器上部署近1000个智能体。
过去几个月,通过与国内很多软件合作伙伴、互联网厂商合作,我们了解到,智能体的数量越多当然越好,但还需要性能足够强、智能体跑得足够快。所以我们更新了衡量指标,尝试从X、Y两个维度来衡量智能体的运行。一个维度是单颗CPU能够承载多少个智能体,另一个维度是每个智能体的性能
这里有几组数据,都是过去两个月我们跟客户实测出来的。首先是SWE-bench基准测试。在客户选择的一组工作负载中,最新英特尔至强6+处理器的单智能体平均性能领先竞品15%。
例如,有客户在云端运行智能体,需要大量启动沙箱,部署更多智能体。他们需要在10分钟之内启动1万个甚至10万个沙箱,同时,每个沙箱的启动速度也要足够快,客户给出的指标是200ms。这个要求非常高。但根据实测,在满足200msSLA要求的条件下,英特尔至强6+处理器可支持350个沙箱并发,约为某一竞品的1.46倍。
另一方面,我们在国内有非常多硬件合作伙伴。无论是OEM还是液冷厂商,之前都在跟我们讨论,未来CPU如果需要那么多核心,支撑那么多AI智能体,是不是要一起做一些新的架构?
很高兴,过去几个月这方面有了一些新进展,我们正在与很多业界合作伙伴共同制定相关标准,根据目前可预见的AI智能体性能需求,综合考虑CPU性能、网络、存储、散热以及供电,打造一套平衡的、全新的面向AI智能体的CPU机架方案,并将很快推向市场。
现在再讲一下GPU。国内现在有很多不同的GPU方案,可以说百花齐放。但是大家也都知道,GPU服务器也需要CPU,帮助完成数据预处理和传输。在中国,英特尔至强处理器是主流的计算服务器里的机头CPU。
我们还有很多特色功能,比如数据预处理。举个例子,我让AI执行一个新任务,每天早上帮我找一下前一天晚上世界上有哪些新的财经新闻,再发一封邮件给我。设定任务之后,AI会上网搜索很多资料,这些资料的格式不同,需要从中提取文字,这就涉及预处理。
提取文字之后,才能将其输入大模型,由大模型帮我们做分析和采集。其中,所有预处理的工作适合由CPU来执行,而不是GPU
通过至强内置的加速器,我们可以把数据预处理工作做得更快、更好。在相关测试中,借助AMX等加速能力,向量化和重排序性能分别达到对比基准的2倍和4倍,国内已经有很多互联网客户在使用英特尔至强AMX加速器,我们也会把这套方案分享给更多有兴趣的厂商。
现在我们讲一下存储。过去一年存储市场非常火热。数据中心的存储架构简单来说就像一个三角形:越接近GPU算力的存储,成本越高,离得越远,成本越低,但速度也越慢。从HBM到系统DRAM,再到本地SSD,以及更远的远端存储,都是如此。
英特尔的CPU在数据搬运中发挥着重要作用,我们一直与软件伙伴合作,希望缩短数据访问的路径。比如,通过CXL实现内存池化,让服务器能够使用更多内存,或者通过软件创新和智能网卡,让远端存储的访问更高效。
过去一个月,我们与焱融科技一起,基于英特尔至强6处理器和MRDIMM内存,打造了一套高性能存储系统,让存储跑得更快,避免数据访问成为瓶颈,昂贵的CPU、GPU也不必空等。随后,焱融科技参与了MLPerf Storage v3.0的测试,在Llama3检查点读写和3D-Unet训练两项测试中取得了全球第一的成绩。我们希望接下来有更多机会与国内软件厂商合作,一起打造更先进的存储。
过去一年,KV Cache被广泛应用。简单来说,它会缓存大模型所产生的所有答案,下一次再问的时候可以直接读取上一次的答案,加快反应速度。
但是,KV Cache也面临一个很大的问题。现在很多新的场景,包括AI智能体和代码编写,上下文越来越长。百万Token上下文已经成为一些开源大模型的重要卖点。这是什么概念呢?如果今天是一个标准的千问的35B模型,你给它100Token上下文,表示它产生的KV Cache就是300GB,已经超过了不少现在GPU上面的内置HBM。
对此,英特尔软件团队也提出了很多想法,打造了一套KV Cache智能加速套件,另外至强内嵌了很多压缩功能,希望能够帮助大家解决这个问题。比如通过QAT进行无损压缩KV Cache,如果原来是300GB的KV Cache,可以在落盘之前压缩200GB。数据传输上,通过DSA也能够达到数据搬运的9.66倍的加速效果。
此前,我们发布了新一代英特尔GPU Crescent Island,这是一款基于全新Xe3P架构打造的下一代GPU产品。面向AI推理和Agentic AI场景设计,它的特性之一就是大显存,通过LPDDR5x技术,可配备128G、256G、甚至是480G的大容量内存,帮助我们更好地进行AI推理和KV Cache存储。
同时,我们也在软件上投入了很多,希望打造完整的工具箱和软件栈,能够在第一时间支持主流的全新的开源大模型,今年晚些时候会有更多产品消息。
过去20年,数据中心的发展一直与开源软件社区密切相关。英特尔始终在开源软件上保持大量投入,包括早期的Linux,后来的Kubernetes。面向AI时代的数据中心,我们也做了大量投入。
在大家耳熟能详的PyTorch、vLLM或者是SGlang等开源项目中,英特尔都做了很多贡献,希望包括Agentic AI在内的新功能能够在社区项目中得到体现,更好地适配不同的硬件。国内很多开发者在这方面也做了很多贡献,我们也希望接下来通过开源社区和大家继续合作、继续创新。
智能体时代才刚刚开始,未来肯定会有很多创新和新的挑战。这也是为什么我个人非常兴奋,因为有了新的挑战,我们才能够与各位一起创新、一起解决问题。
成为付费用户可以阅读 英特尔 所有资料
了解更多 →