很多人第一次接触AI时,会有一个很自然的疑问:
芯片越来越快,模型越来越高效,AI公司也天天在研究怎么降低成本,为什么整个行业需要的算力反而越来越多?
答案藏在一个很容易被忽略的变化里:AI正在从“训练一个模型”,进入“让模型持续工作”的阶段。
过去讨论AI算力,大家最熟悉的场景是训练。几万张GPU同时运行几周甚至几个月,把海量数据“喂”给模型,最后得到GPT、Gemini、Grok这样的产品。
训练确实非常消耗算力,但它有一个特点:训练完成之后,这一轮大规模计算基本就结束了。
现在真正快速增长的另一部分,是推理(Inference)。
简单理解,训练是“让AI学会东西”,推理则是“AI每一次真正帮你干活”。
你在聊天框里问一句话,AI回答一次,需要推理;让AI生成图片,需要推理;让Coding Agent检查几千行代码,需要推理;让企业内部Agent读取文件、搜索资料、调用工具、分析数据并生成报告,背后可能连续发生几十次甚至上百次模型调用。
这也是为什么2026年的AI基础设施讨论里,“Inference”出现得越来越频繁。Google今年4月披露,其模型通过客户直接API调用处理的规模已经超过每分钟160亿个Token,上一季度约为100亿个。换句话说,AI真正进入应用之后,算力消耗会随着使用量不断发生。
AI为什么会越用越“费算力”?
第一个原因,是AI正在从“回答问题”变成“思考问题”。
早期Chatbot的工作模式比较简单:
用户输入一句话,模型生成一段回答。
现在的Reasoning Model完全不同。面对复杂问题,它可能需要进行更长的内部推理,然后才生成最终答案。
这意味着,同样是回答一个问题,模型真正计算的Token数量可能已经完全不同。
NVIDIA在2026年年报中也特别提到,Reasoning Model会在最终回答之前产生大量“thinking tokens”。这些Token用户不一定全部看到,但GPU依然需要完成相应计算。
所以未来衡量AI算力需求,不能只看“全球有多少人在使用AI”,还要看另一个数字:
每一次AI任务需要多少计算。
如果用户数量增长10倍,同时每个任务背后的计算量也增长10倍,基础设施面对的就不是简单的10倍增长。
第二个变化:Agent开始出现
如果说Reasoning Model让AI“想得更久”,Agent则让AI“干得更多”。
普通Chatbot收到一次问题,通常完成一次主要任务。
Agent的逻辑可能是:
读取任务,分析目标,搜索资料,调用工具,检查结果,发现错误,重新执行,再调用另一个模型,最后整理答案。
一个用户表面上只点击了一次按钮,后台却可能发生一整条计算链。
比如你让AI:
“研究这家公司最近一个季度的情况,然后整理成一份报告。”
AI可能先搜索资料,再阅读几十份文件,然后提取数据、调用代码工具、进行计算、生成图表,最后写报告。
人类看到的是一个任务,数据中心看到的却可能是几十次模型调用。
这就是Agent时代非常重要的一点:AI使用量已经不能简单按照“用户发送了多少条消息”计算。
未来真正重要的指标之一,很可能是每个任务消耗多少Token,以及整个系统每秒能够生产多少Token。
第三个变化:AI需要记住越来越多东西
还有一个经常被普通投资者忽略的问题:Context,也就是上下文。
以前模型可能只需要处理几千个Token。
现在越来越多AI应用需要读取整份PDF、几十封邮件、代码库、企业数据库,甚至持续保存一个Agent执行任务过程中的上下文。
上下文越长,模型需要处理和保存的信息就越多。
这也是为什么今天AI基础设施的瓶颈已经不只是GPU计算能力。
HBM高带宽内存、普通DRAM、SSD、网络互联、数据中心电力和散热,都开始进入同一个问题。
TrendForce今年专门讨论了AI推理带来的内存需求,其中一个重要原因就是Agent和长上下文产生的大量KV Cache,需要更复杂的存储与内存层级支持。
所以所谓“AI算力”,其实已经越来越像一整套基础设施:
GPU负责计算,HBM负责快速提供数据,高速网络负责让大量GPU协同,存储负责保存模型和上下文,数据中心提供电力和散热,最上层的软件则负责调度这些资源。
任何一环跟不上,昂贵的GPU都可能无法充分发挥性能。
算力越来越贵吗?事情恰恰更有意思
这里出现了AI产业非常重要的一个经济现象:
单个Token的计算成本可以不断下降,同时整个行业的算力需求继续增长。
这两个事情完全可以同时发生。
比如一辆汽车百公里油耗从10升下降到5升,如果汽车使用量增长十倍,总燃料需求依然可能增加。
AI也类似。$
新GPU、更低精度计算、模型压缩和推理软件优化,都在降低生成Token的成本。NVIDIA披露的数据显示,在特定测试条件下,其Blackwell平台通过硬件和软件优化已经明显降低单位Token成本。
但成本下降之后,AI可以进入更多场景。
以前一次AI调用成本1美元,公司可能只敢用在高价值任务上;未来如果成本降到几分钱,它就可能被嵌入客服、搜索、广告、办公软件、编程、金融分析、机器人甚至汽车里。
于是出现一个看起来很矛盾的结果:
AI越便宜,人们越敢用;人们越敢用,Token生成量越大;Token越多,背后的总算力需求也可能越高。
所以,AI基础设施正在从“训练模型”走向“生产Token”
这可能是理解下一阶段AI产业非常关键的一层。
第一阶段,行业比的是谁能够训练出更大的模型。
第二阶段,开始比谁能够用更低成本、更低延迟,把模型提供给更多用户。
进入Agent阶段之后,竞争继续向前推进:
谁能够在有限的GPU、电力和数据中心资源下,稳定地产生更多有价值的Token。
这也是为什么今天行业开始越来越频繁地讨论“cost per token”“tokens per watt”和“tokens per second”。
算力的商业逻辑正在发生变化。
GPU不再只是训练大模型时使用的一次性工具,它正在逐渐变成AI服务持续运行的生产资料。只要用户还在和AI对话、Agent还在执行任务、机器人还在做决策、代码助手还在写代码,推理就会持续发生。
所以“AI越来越吃算力”背后真正值得关注的,并不是模型参数是不是又增加了一倍。
更重要的变化是:
AI开始从一个偶尔被调用的软件,变成一个持续运行的计算系统。
训练一个模型,可以有结束的那一天。
但如果未来数十亿人和大量企业每天都有AI Agent在后台工作,真正庞大的计算需求,可能恰恰发生在模型训练完成之后。
这也是为什么到了2026年,理解AI基础设施已经不能只盯着“下一代GPU有多快”。
更值得理解的问题开始变成:
一座数据中心一天究竟能够生产多少Token,以及生产这些Token需要付出多少成本。
当行业开始用这个角度计算AI,算力也就从一个技术指标,逐渐变成了一门真正的规模生意。
精彩评论