AI

都在抢GPU,为什么CPU也不够用了?

当 AI 从生成答案走向执行任务,算力瓶颈也在移动。沿着智能体的工作链条,看 CPU 需求为何上升,以及短缺能否持续。

AI算力的抢购清单上,CPU正变得越来越显眼。

9月底,渠道消息称,AMD第六代EPYC处理器Venice的2027年产能已被预订,订单开始排向2028年。这一说法尚未获得AMD官方确认,但服务器CPU的供给压力已经引起关注。消息来源

英特尔也发出了紧缺信号。据媒体对Splunk .conf26的报道,公司CEO表示,目前只能满足客户约一半的CPU需求。这一数字不能直接换算成全球缺口,但英特尔二季度正式披露已确认需求超过可供给数量,并预计基板、内存等关键部件的行业性短缺将持续至2027年。发言报道;英特尔季度报告

理解这轮变化,需要看清AI正在接手什么工作。生成一段答案,与完成一项任务,对算力的要求很不一样。

当AI开始替人执行任务,CPU承担的工作也随之增加。

AI算力体系中的GPU与CPU协同
AI算力体系中的GPU与CPU协同

一、GPU算得再快,也得等其他环节

让一个编程智能体修复错误,它要做的远不止生成几行代码。

它需要读取项目、提出方案、修改文件,再启动环境、编译、运行测试。如果测试失败,就把报错交回模型,修改后再试。

模型计算主要依靠GPU,代码执行和大量工具工作依靠CPU。一次任务要在这些环节之间往返,交付速度取决于整条流程。

算一笔简化的时间账:假设完成一项任务原本需要100秒,其中模型计算占90秒,其他暂时无法加速的步骤占10秒。

环节GPU升级前模型计算提速10倍后
模型计算90秒9秒
其他步骤10秒10秒
总耗时100秒19秒
阿姆达尔定律简析:局部提速10倍,执行环节成为主要耗时瓶颈
阿姆达尔定律简析:局部提速10倍,执行环节成为主要耗时瓶颈

GPU负责的部分快了10倍,整项任务只快了约5.3倍。原来占十分之一的其他步骤,此时已经占去超过一半的时间。

这就是阿姆达尔定律揭示的约束:任务规模固定时,局部加速的收益,会受到剩余步骤的限制。表中的数字用于说明机制,并非真实智能体的平均耗时。英伟达CUDA最佳实践指南

但瓶颈更突出,还不等于CPU需求一定增长。每天只处理同样数量的任务,GPU升级可能只是缩短等待;网络延迟、磁盘访问和串行依赖,也未必能靠增加CPU解决。

真正推动采购的是下一步:企业把释放出来的GPU能力,用来同时处理更多任务。更多代码需要编译,更多测试需要运行,更多执行环境需要启动,CPU的总工作量才随之上升。

二、一个人提问,一群智能体干活

智能体正在把这一步变成现实。

人和聊天机器人对话,通常需要停下来读答案、想一想,再继续提问。人的阅读和判断速度,会限制请求频率。

智能体收到一个目标,可以自行执行多轮“规划—调用工具—检查结果—重试”。一次修复要求,可能触发几十次测试;一项资料整理任务,可能带来大量网页访问和数据库查询。多个智能体还可以同时执行不同的子任务。

用户只交代了一件事,后台可能已经运行了许多轮计算与工具调用。

智能体自主执行闭环:GPU模型推理与CPU执行环境交替协作
智能体自主执行闭环:GPU模型推理与CPU执行环境交替协作

这种扩张依然受到预算、权限和成功率的限制。企业愿意持续运行智能体,前提是完成工作的收益能够覆盖调用、执行和复核成本。一旦这个条件成立,CPU负载就不再只由人的提问次数决定,还取决于每项任务需要多少次尝试、多少个执行环境。

训练智能体也会增加这类需求。模型学习写代码、使用工具,需要反复尝试并检验结果,许多工具和环境运行在CPU上。

英伟达在2026年3月发布Vera CPU时,介绍了一种配备256颗CPU、可支持超过22500个并发CPU环境的机架。按照厂商披露的设计,这些资源服务于大规模执行与训练环境。Vera CPU发布公告

TrendForce也预计,智能体部署中的CPU与GPU数量配比,将从传统大模型场景的1∶4至1∶8,向1∶1至1∶2变化。这个判断针对特定部署场景,反映的是执行工作增加之后,硬件配置需要重新调整。TrendForce分析

三、CPU能加单,产能却不能立刻加速

需求的变化,遇上了供给扩张的时间差。

AMD已宣布Venice在台积电2纳米工艺上爬坡。新一代CPU同样需要先进制程资源,而晶圆制造只是交付的第一步,后面还有封装、基板、内存和整机配套。AMD量产爬坡公告

任何一环缺货,都可能让已经造出来的芯片无法及时变成可用服务器。英特尔披露的基板和内存约束,正说明供给压力已经延伸到处理器之外。英特尔季度报告

更多执行环境还需要更多内存容量、带宽,以及电力与散热支持。增加CPU采购量,实际上也在给整套配套设施增加订单。

企业可以很快提高软件端的并发需求,硬件厂商却要增加设备、提高良率、协调部件,再完成平台验证。采购计划与可交付的计算能力之间,隔着一段无法跳过的时间。

服务器芯片与硬件交付链条:从晶圆制造、先进封装基板到整机配套
服务器芯片与硬件交付链条:从晶圆制造、先进封装基板到整机配套

这段时间有多长,要看具体瓶颈。现有产线调整、新品放量和供应商扩产都可能缓解紧张,也都需要接受实际交付的检验。

四、同一座数据中心,可能需要更多CPU

CPU需求有多大,还取决于数据中心里运行的是什么任务。

Arm在2026年3月的演讲中估算,传统AI数据中心每吉瓦对应约3000万CPU核心,智能体场景可能提高至1.2亿核心。这是厂商对特定场景的测算,包含与加速器相邻的CPU资源,并非所有数据中心的统一标准。Arm演讲原文,第3—4页

借用这两个端点,可以做一个简单的敏感性分析。

假设新增投运的AI容量为G吉瓦,其中采用高CPU需求智能体配置的容量占比为p。采用线性插值,新增核心需求可以写成:

新增CPU核心需求 = G ×(3000万 + 9000万 × p)

以假设的10吉瓦新增容量为例,结果如下:

高CPU需求智能体配置占比所需CPU核心按每颗128核折算
10%3.9亿约305万颗
30%5.7亿约445万颗
60%8.4亿约656万颗
数据中心任务结构演变对CPU核心需求的影响
数据中心任务结构演变对CPU核心需求的影响

这里的10吉瓦、配置占比、线性插值和128核换算,都用于展示情景,不代表年度预测或行业平均配置。不同架构的核心也不能完全等量替代。

这笔账揭示的关键是:即使新增容量相同,仅任务结构变化,就可能让CPU需求相差一倍以上。

要进一步计算全球缺口,还需要加入通用服务器更新、既有AI设施升级和设备复用,再与各厂商的实际有效供给比较。目前公开数据还不足以填齐这张账本。

因此,2027年新品集中放量能否缓解紧张,取决于供给增加的同时,每座数据中心的CPU需求又提高了多少。判断未来是否平衡,必须同时看扩产速度、任务结构和软件效率。

五、短缺能持续多久,要看AI接到了多少真活

预订火热,需要最终使用需求来兑现。

客户担心拿不到货,可能提前采购,甚至重复下单。交期越长,囤货动机越强。如果实际任务增长没有跟上,今天的预订也可能变成明天的库存和砍单。

软件效率同样会改变需求。减少无效重试、复用执行环境、合并查询,都能降低完成一项任务所需的CPU资源。数据中心建设放缓,也会压低新增采购。

观察这轮短缺,可以抓住三个信号:

  • 交期:同类服务器CPU的交付时间,是否持续拉长。
  • 量价:厂商收入增长中,有多少来自实际出货,有多少来自高端产品占比提高和涨价。
  • 使用:云厂商的建设与采购计划,是否转化为投运容量和持续运行的任务。

量价尤其容易被混淆。英特尔二季度服务器平均售价同比提高48%,出货量提高9%,并披露售价增长主要来自高端产品占比提升。收入增长很快,未必意味着卖出的CPU同样多,更不能直接换算成市场缺口。英特尔季度报告

CPU重新受到关注,背后是AI工作范围的扩大。模型能够提出更多方案之后,还需要系统执行代码、调用工具、读取数据、检查结果。企业真正购买的,是这些环节共同交付的一项工作。

CPU短缺能否持续,最终取决于企业愿意付钱交给AI完成的工作,能否增长得比整套基础设施更快。

保持联系

每周日,留一点时间认真想想。

每周更新一篇文章,记录投资、技术与成长中的思考。所有内容免费开放,也欢迎通过 RSS 持续阅读。

微信公众号

使用对应 App 扫码关注,也可保存图片后在 App 中识别二维码。

Solo Primus · 微信公众号 · 查看二维码
保存二维码打开原图

抖音

使用对应 App 扫码关注,也可保存图片后在 App 中识别二维码。

Solo Primus · 抖音 · 查看二维码

账号 98502180065

保存二维码打开原图

小红书

使用对应 App 扫码关注,也可保存图片后在 App 中识别二维码。

Solo Primus · 小红书 · 查看二维码

账号 soloprimus

保存二维码打开原图