跳转到主要内容

万亿参数之后,国产算力还有多大的市场?壁仞给出了一个答案

8月28日晚间,国产GPU企业壁仞科技披露2026年中期业绩。一组数字首先跳了出来:2026年上半年营收12.36亿元,同比增长约1997.6%;期内亏损3.77亿元,同比大幅收窄76.4%;经调整期内亏损3.37亿元,同比减亏38.9%。

更值得注意的是,12.36亿元的半年营收,已经超过壁仞科技2025年全年10.35亿元的收入。对于一家仍处于高研发投入阶段的国产GPU企业来说,这不只是一次业绩增长。

它更像是一个信号:国产算力正在从产品验证期,逐渐进入规模化商业化阶段。而推动这一变化的,并不仅仅是国产替代。更深层的变量,是AI正在进入一个新的算力周期——Agentic应用加速落地,模型参数继续膨胀,上下文窗口不断扩大,Token消耗量快速增长。

当AI从“训练一个模型”变成“无数Agent持续调用模型”,算力市场的天花板,也正在被重新计算。

一、Token正在重新定义算力市场

过去讨论AI算力市场,最容易想到的是GPU。需要多少张卡、单卡多少TFLOPS、显存多大、集群有多少P算力,构成了过去几年算力产业最核心的指标体系。

但进入Agentic AI时代之后,产业的计量单位正在发生变化。AI编程、AI搜索、智能客服、企业Copilot、内容生成以及各种Agent应用,都意味着模型被更加频繁地调用。

一次复杂的Agent任务,并不是一次模型推理就结束,而可能需要连续进行规划、调用工具、读取上下文、生成结果,再次推理。模型越大,上下文越长,Agent任务越复杂,Token消耗就越大。这意味着AI算力需求正在从过去的“集中式训练需求”,逐步转向“训练+推理双轮驱动”。

市场空间也因此被进一步打开。

根据弗若斯特沙利文的数据,中国AI计算加速芯片市场规模预计将从2024年的1425亿元增长至2029年的1.34万亿元,2025—2029年的复合增长率达到53.7%。如果把视角进一步拉向推理端,灼识咨询预计,中国AI推理芯片相关产品及服务市场规模到2030年将达到2.11万亿元。

这两个数字并不意味着国产GPU企业都能分享万亿市场,但它们说明了一件事:

AI算力的需求曲线,可能远没有到顶。

过去GPU主要解决“模型能不能训练出来”,未来还要解决“模型每天被调用多少次”。而后一个问题,对算力基础设施提出的是持续性需求。

二、壁仞财报里的一个变化:客户开始从“试用”走向“批量采购”

市场空间是一回事,真正重要的是需求有没有转化成订单。从壁仞科技2026年中期业绩来看,这一变化已经开始出现。

今年上半年,壁仞科技壁砺系列产品销售持续扩大,多个标杆项目落地,并完成了互联网大客户供应商引入认证,开始批量交付产品。

这一点的产业意义很大。

互联网和云厂商是AI算力市场中技术门槛最高、需求规模最大的客户之一。能够进入供应商体系,意味着国产GPU开始从单个项目验证,进入更稳定的商业采购周期。

与此同时,壁仞科技的客户结构也在发生变化。

目前公司客户已经覆盖头部互联网企业、AI大模型开发商、国家级AI算力平台、AI数据中心、电信运营商,以及制造、能源、公用事业、金融科技、教育等行业客户。

换句话说,国产GPU正在从“某几个客户的国产化项目”,逐渐走向更多真实业务场景。

这种变化也直接反映在财务数据上。2026年上半年,壁仞科技毛利达到5.27亿元,同比增长2708.5%,毛利率提升至42.7%,同比提升1080个基点。营收快速增长,同时毛利率明显改善,说明产品商业化正在逐步形成规模效应。

从财报看,壁仞仍然是一家重研发企业。今年上半年研发投入达到8.04亿元,同比增长40.7%;近三年半累计研发投入已经达到39.93亿元。在此研发高投入下,积极的信号是,壁仞科技正在加速收窄亏损,临近盈亏平衡点,这意味着公司在用高强度研发换取下一代产品的竞争力。但与过去不同的是,研发投入开始越来越多地被商业化收入“接住”。这可能是国产GPU产业最值得关注的变化之一。

三、供给侧的竞争,正在从“国产替代”进入“规模交付”

国产GPU过去最大的标签是“替代”。但替代只是进入市场的第一张门票。真正决定企业能不能做大的,是产品力、产能和交付能力。这一点从壁仞科技的供应链数据也可以看出来。

截至2026年6月30日,公司存货达到12.15亿元,比2025年末增长28.1%;存货及服务相关预付款项达到15.34亿元,较2025年末增长230%。

从财务角度看,存货和预付款的快速增加意味着资金占用压力上升;但从产业角度看,它同时意味着公司正在为更大规模的客户需求提前准备供应链。尤其是在当前高端AI芯片供应链仍然受到产能、先进封装以及关键器件约束的情况下,能不能提前锁定产能,本身就是竞争力。

壁仞科技7月完成H股配售,募集资金净额约70.4亿港元,也为后续研发、战略采购和供应链布局提供了更大的资金缓冲。

这说明国产算力竞争正在变得越来越“重”。不只是研发重,供应链也重;不只是设计芯片,还要解决量产、备货、服务器、集群以及最终交付。因此,未来国产GPU的竞争格局,很可能不再是简单的“谁的芯片参数最高”,而是:谁能把芯片稳定地变成一座座真正运行的智算中心。

四、真正的换道窗口:超节点、Chiplet与光互连

而这正是国产算力下一阶段最值得观察的地方。当AI模型继续向万亿乃至数万亿参数发展,单卡性能的重要性依然存在,但系统级能力的重要性会快速上升。

因为当计算规模从几十张GPU扩大到几百、上千张甚至数千张GPU之后,瓶颈不再只是计算能力。

GPU之间怎么通信?内存带宽够不够?节点之间的延迟是多少?通信功耗有多大?如何让数千颗GPU保持较高的有效利用率?这些问题最终都会落到Scale-up、超节点和高速互连上。

壁仞科技正在沿着这条路线推进。

其下一代产品基于自研指令集、计算核心和Chiplet架构,在计算、内存容量与带宽以及互连能力上全面升级,并支持FP8、FP4低精度计算。同时,公司自研BLink 2.0互连协议,最大支持1024卡Scale-up扩展,并原生集成超节点互连能力。

在此基础上,壁仞构建了:16卡标准服务器、128卡高密整机柜、1024卡分布式解耦架构的三级超节点产品矩阵。其中最值得关注的是1024卡NPO光互连方案。

今年WAIC期间,壁仞发布新一代NPO光互连超节点方案,完成从传统电互连向NPO光互连的技术演进。

为什么要做这件事?

因为当GPU数量不断增加,传统电互连在带宽、距离、功耗等方面的压力会越来越明显。光互连的价值,并不是简单地让“通信更快”,而是试图把整个AI集群的Scale-up能力继续向上推。

壁仞科技与上海仪电、曦智科技、中兴通讯联合发布的商用版“光跃”光互连光交换GPU超节点,已经实现数千卡规模部署。

更重要的是,实测典型MoE模型端到端训练性能提升超过30%。这类数据的价值,比单纯公布一颗芯片的峰值算力更高。

因为它回答的是一个更加实际的问题:当GPU从一张卡变成数千张卡之后,整个系统还能不能保持效率?这可能才是万亿参数乃至数万亿参数模型时代真正的技术战场。

五、FP8/FP4之后,国产GPU拼的是“每个Token的成本”

与此同时,低精度计算也在改变算力经济学。FP8、FP4并不只是芯片厂商产品规格表上的两个新名词。它们背后对应的是一个非常现实的商业问题:同一个模型,用更低精度完成计算,能不能在保证精度的情况下,用更少的计算资源完成同样的任务?

如果答案是肯定的,那么最终就意味着更低的推理成本。对于AI基础设施来说,这一点非常关键。未来客户购买的不会只是“多少P算力”,而会越来越关注:模型吞吐是多少?单位功耗能跑多少Token?每张卡每天能产生多少有效计算?一个模型部署下来,每百万Token究竟需要多少成本?这也是为什么壁仞下一代产品同时强化FP8/FP4、内存带宽和互连能力。

单卡算力只是起点,系统效率才决定Token成本。而Token成本,又最终决定AI应用能不能大规模商业化。

六、硬件之外,生态才是国产算力真正的“最后一公里”

如果说超节点决定了算力规模的上限,那么软件生态决定的就是这些算力到底能不能被用起来。这是国产GPU过去最容易被低估的一环。

一个GPU硬件性能再强,如果模型适配周期长、算子效率低、框架迁移困难,客户最终还是会回到成熟生态。壁仞科技今年在软件生态上的动作,实际上是在解决这个问题。

公司持续完善BIRENSUPA软件栈,并推出面向多智能体的软件平台SUPACODE,通过模型分析、算子调优、通信优化和智能诊断等能力,缩短新模型架构的适配和调优周期。

截至2026年上半年,公司已经完成DeepSeek-V4、智谱GLM-5、Qwen3.6、Kimi K2.6等多款旗舰模型的“Day 0”级适配,累计支持近30款国产大模型。

这里有一个细节值得注意:“Day 0适配”比“支持多少模型”更重要。因为AI模型更新速度越来越快。

如果一个新模型发布之后,芯片厂商需要几个月才能完成适配,那么模型热度可能已经过去;反过来,如果能够在模型发布时快速完成适配,国产算力才有可能真正进入开发者和企业的日常工作流。

壁仞牵头制定的跨厂商异构混训国家标准也已经进入批准发布流程,异构混推国家标准正在推进。这意味着国产算力生态正在从“各自兼容”,走向“互联互通”。长期来看,这可能比单个芯片的性能提升更加重要。

因为AI算力的终局,很可能不是一家厂商包打天下,而是多种芯片、多种架构、多种算力资源长期共存。

七、国产算力真正的竞争,已经变成一场系统工程

把壁仞科技2026年中期业绩放回产业环境里看,会发现这家公司正在经历的,其实也是整个国产GPU行业正在经历的变化。

第一阶段,比的是有没有芯片。第二阶段,比的是芯片性能够不够。

第三阶段,则开始比:能不能量产、能不能交付、能不能组成千卡集群、能不能跑主流模型、能不能降低Token成本。

这也是为什么今天评价一家国产GPU企业,已经不能只看TOPS、TFLOPS或者制程节点。需要看的,是一整套体系。

壁仞科技上半年营收12.36亿元、毛利率提升至42.7%,说明商业化开始进入放量阶段;8.04亿元研发投入,说明下一代产品仍在持续迭代;12.15亿元存货以及15.34亿元存货与服务相关预付款,则说明公司正在为更大规模交付准备供应链。而Chiplet、FP8/FP4、1024卡Scale-up、NPO光互连和软件生态,则对应着下一代算力基础设施的技术方向。

这些东西组合起来,才构成一家国产算力公司的真正壁垒。

结语:万亿参数不是终点,Token才是新的“算力单位”

所以,再回头看“国产算力的市场天花板”,答案可能比单纯计算GPU市场规模更加复杂。

万亿参数模型会带来更多算力需求,但真正决定市场能走多远的,是AI应用到底会消耗多少Token。

模型越大,Agent越复杂,调用越频繁,Token就越多。而Token越多,对算力的需求就越接近一种持续性的基础设施需求。这也意味着,国产算力未来真正需要争夺的,并不是简单意义上的GPU市场份额。

它需要争夺的是:训练规模、推理规模、超节点规模,以及每一个Token背后的计算成本。

壁仞科技2026年上半年营收首次在半年时间里超过上一年度全年,亏损大幅收窄,互联网大客户开始批量导入,同时向Chiplet、FP8/FP4、NPO光互连和超节点继续推进。这些变化说明,国产GPU正在跨过一个关键阶段。

但这还不是终点。下一轮竞争会更加残酷——从“能不能做出来”,变成“能不能规模化跑起来”;从单芯片竞争,变成芯片、软件、系统、供应链的整体竞争。所以笔者认为最终能够跑出来的国产算力公司,不一定是某一个指标最漂亮的公司,而一定是能够把产品、生态和交付真正串起来的公司。

而万亿参数时代的市场天花板,也许就藏在每一个不断增长的Token里。

对此,大家怎么看?欢迎留言讨论!

附:一图读懂壁仞科技2026年半年度报告