《云厂商的AI决战》是昨天发布的, 在其中, 我们谈到了一个关键判断, 那就是如今的AI云竞争, 早就不再是比拼谁家GPU数量多、Token流转速度快的时候了, 甚至已经步入了全栈AI Infra更深层次的阶段范畴了。今日, 咱们就沿着这个思路, 再迈向更深的一层: 既然决定胜负的关键并非表面的指标, 而是潜藏于深处的效率, 那么究竟应当通过何种方式, 去评判一家云厂商是否真的具备强大的竞争力呢?将目光投向2025年, AI Infra的发展已然明晰地历经了一个关键的转折点。在刚刚过去的一年当中, 模型能力的跨越已然不再仅仅只是在于关于参数规模的比拼, 而是现如今越来越多地已然被算力的可得性、成本的构成结构以及部署的效率所作出的重新界定了。在头部的厂商那里, 于GPU云、算力的调度、异构的集群以及工程化落地的能力方面所存在的差距正逐步地加大。而这样的一种分化, 正决定着究竟是谁具备真正承载下个阶段AI商业化浪潮的能力。正是在这样的进程当中, 某些曾经被大量广泛依赖的评估标准, 开始显露出它们自身的局限性来了。比如, Token这个指标, 它易于量化, 且便于传播, 一度被部分厂商当作衡量AI云市场的北极星。但现实却是不同的答案, 国家统计局最新数据表明, 2025年中国日均Token消耗量, 从年初的约1000亿飙升到了30万亿。但据全球权威技术市场研究机构Omdia统计, 按Token计费的MaaS服务收入, 仅占整个AI云市场规模的不到1%。考察其背后缘由, 大量出现于GPU云租赁、私有化部署乃至端侧设备的AI算力消耗, 根本没办法被MaaS平台统计。把Token等同于AI云本身, 不但忽视了中国数字化市场复杂多样的需求, 甚至还可能误判了真正的技术护城河。同样具备误导性的还有对硬件数量的迷信, GPU的绝对数量并不等同于稳定、高效的可用算力, 某头部云厂商的模型市场里曾出现17.7%的GPU算力仅仅用于处理1.35%的极少量请求, 资源浪费极为严重。由此能够明显看出, 去评估一家云厂商所具备的GPU云方面的实力, 并非仅仅只管Token的消耗数量或者GPU卡的数量就行的, 而是应当着重去关注其底层系统所拥有的整体效率以及可控性。然而要达成这种效率以及可控性, 通常情况下是离不开对于基础设施那种深度的掌控状态的。正是处于这样的一种背景状况之下, 那些拥有自研GPU云能力的厂商渐渐显出了结构性的优势, 它们不但能够避开通用硬件的性能方面的瓶颈以及供应链所存在的风险, 而且还能够在软硬协同、调度优化以及成本控制这些方面达成更高维度的突破。于是, 在堆砌硬件的竞赛渐渐失效之后, 在大模型步入工程期之时, 一个更为深刻的问题浮现于水面: 云厂商挑选什么样的AI Infra建设路径才切实可持续? 对于那些有志于拥抱AI的企业来讲, 决定其智能化进程成败的, 到底是采购了多少数量的芯片, 还是选择一个具备何种系统性效率的合作伙伴?于模型飞速发展的关键阶段, 翻开随便一篇有关AI基础设施的报道, 差不多每篇都会见到这般的探讨何人又获取了多少H20或者B200? 哪一家云厂商降低价格了多少? 卡的类型、规格、单价、交付周期……好像只要具备更多高端GPU, 便能够于这场AI竞赛里取胜。在过去的一段时期之内, 这种“唯卡论”的叙事实实在在地主导了市场的情绪, 毕竟, 在大模型训练对算力高度依赖的这样一种背景状况之下, 硬件好像成为了最为直观的能够决定胜负的关键因素, 然而, 伴随行业历经从狂热扩张朝着理性落地的转变过程, 越来越多的实践案例开始去揭示这样一个行业的现实情况, 就是拥有算力, 并不等同于能够将算力很好地加以运用, AI算力的价值, 最终是要借助高效、稳定以及可规模化的服务形式才能够释放出来的。而在这当中, 最为关键的板块便是GPU云, GPU云身为AI基础设施里面的核心, 它具体的竞赛逻辑已然产生了根本性的变革。一方面, 高端GPU的供应链呈现出非常高度集中的态势, 并且波动程度极为剧烈。被市场机构IDC统计得出的数据清楚显示, 英伟达在训练级AI芯片, 像H100、H200、B200这些领域当中, 占据着全球超过90%的市场份额。而鉴于在中国市场, 受到出口管制这一因素的深刻影响, 有数据表明, H20、L20等合规型号的供应是持续性处于一种紧张的状态, 价格的波动幅度非常剧烈, 交付周期长达数月之久, 就算企业心甘情愿支付溢价费用, 也很难必定成功及时地拿到它所需要匹配的那部分资源。但存在比拿不到此事而更显棘手的状况, 那便是“用不好”这种情形。就拿近期备受众人关注的英伟达H200来说吧, 尽管已然有消息传播出来, 提到春节之前能够交付达数万颗这样的讯息, 然而就算该项交易得以达成形成, H200它本身也早就并非处于技术前沿的状态了。它的下一代系列也就是比如B200/GB200此类的, 它们的性能是更高的水平。更为关键重要的一点是, 即便企业最终成功采购获取到了H200, 要是缺乏底层系统整合方面的能力, 依旧是很难去发挥出它所具备的潜力的。众多智算中心直接去部署整机柜设备, 然而在其上层则遇到调度系统呈现出割裂之状况, 通信协议存在不统一的情形, 驱动与框架方面适配也较为粗糙, 上述这些问题致使跨节点任务调度效率变得低下, 故障恢复显得缓慢, 资源碎片化程度极为严重, 最终的结果常常是显存被占满, 算力发生空转。“2025云网智联大会”上, SNAI推委会荣誉主席韦乐平指出, 当前国内智算中心已超280个, 看似算力充沛, 然而GPU平均利用率不足30%, 并且分布极不均衡, 大量设施长期闲置或低效运行, 暴露出典型的“有硬件、无体系”短板, 这一矛盾在现实中尤为突出。随着MoEof等新一代大模型架构的普及, 对算力调度精度、通信效率和资源弹性的要求大幅提升, 进一步放大了能用与好用之间的鸿沟。显然, 问题并非存在于芯片自身, 而是在于欠缺一套具备自主可控特性, 且软硬协同的全栈技术底座。如今, GPU云竞争早就已经跨越了资源囤积阶段, 已然进入到系统工程的深水区, 此竞争成为了芯片、集群、调用、稳定性以及商业化服务进行有机整合的多方综合博弈。在这样的行业转折点之际, 百度昆仑芯以及华为昇腾等国产AI芯片开始崭露头角, 还赢得了越来越多头部客户的实际认可, 国际权威咨询机构弗若斯特沙利文发布了《2025年中国GPU云市场研究报告》, 该报告清晰捕捉到了这一趋势, 报告首次将“自研AI加速芯片 万卡级算力集群 云服务商业化能力”当作三大核心维度, 对中国GPU云市场进行系统评估。先说, 2025年上半年的时候, 在中国其自身研发的GPU云的市场当中, 百度的智能云凭借了40.4%的市场占比处于第一名, 华为的云因29.5%的所占份额位列第二名, 然其他那些厂商加起来的份额是30.1%, 与此同时, 非常有必要去留意这样一点事项, 在这之前, 百度智能云有连续六年都是稳稳地处在AI云这一领域的最前面位置, 处于榜首。刚开始看的时候, 这好像只是又一份厂商的排名, 然而结合当下GPU云市场的真实情况, 这个第一名实际上揭示了一个更深层次的趋向, AI基础设施的竞争正从争抢显卡迈向使用显卡, 还有更深层级、更具系统性的谋篇布局。循着这条路径, 来看一看我们能够以颇具领先地位的百度智能云此等案例的情形, 探究了解一下, 为何 GPU 云竞赛的焦点并非是某一个单独的指标, 而是已然转变成为了一整个涉及系统工程方面的转型。进行自主研发的人工智能基础设施, 从来都不是一条能够轻松前行的道路, 它存在投入巨大的情况, 有着周期较为漫长的状况, 还有技术风险颇高的问题, 任何一个环节如若出现状况, 都极有可能使前期所做出的全部努力化为乌有, 并且在短时间之内很难看到商业方面会有回报。正是因为这样的缘故, 虽然“全栈自研”被广泛地当作是具备长期竞争力的关键所在, 然而真正亲身投入参与其中的玩家却少之又少。目前这个阶段, 在国内的AI云市场当中, 只是有百度智能云、华为云等少数处于第一梯队的厂商选择坚定地坚守这一路径, 并且构建形成了从底层的算力直至上层的应用这样高效率的闭环。追寻他们崭露头角的线路, 一个核心疑问显现出来: 占据首位, 到底是源自何种情境?基于报告予以审视, 答案并非是某一个单点技术所实现的突破, 而是涉及到一整套所涵盖的, 关于自研芯片的, 以及集群规模的, 还有云服务能力方面的长期实践。拿百度智能云来说, 从硬件底层起始, 它就挑选从自己研发的AI芯片昆仑芯着手切入, 给整个算力体系留出了持续发展变化的空间。算力架构并非被通用硬件禁锢, 而是能够依据真实模型需求进行动态优化。需要留意的是, 昆仑芯的研发生源自十多年前百度对大规模搜索场景下FPGA加速器的深入探寻, 它从问世开始, 就带有为AI基础设施服务的强烈特质。当前, 昆仑芯已达成数万卡的规模化布置, 为招商银行、南方电网、中国钢研等上百家行业客户提供服务。当前, 昆仑芯不但能够在大规模方面对百度内部的推理业务予以支撑, 而且在训练层面收获了一定成果, 就在不久之前所发布的全新一代AI芯片, 于面向大规模推理场景展开深度优化的当儿, 还会推出更适配多模态模型超大规模训推的产品, 以此为后续的算力演进预留出空间。芯片仅仅只是起点, 若要去释放规模算力的真正价值, 那还得需要更高维度的系统整合才行。基于此, 在节点层这个层面, 百度智能云又进一步构建了百度天池超节点, 借助更高密度的算力组织以及更低延迟的互联, 从而为大规模并行计算提供稳定的基础条件。按照百度智能云官方所披露的情况来看, 相较于上一代产品, 天池256超节点的整体性能提升了50%, 天池512超节点单个超节点就能够去支撑万亿参数模型训练, 使得跨节点通信开销与任务碎片化得到大幅降低。强悍的单节点情形可以将算力使用中的性价比于进一步层面予以提升, 并且会使得集群的建设加快速、趋于更迅速。在2025年4月这个时间节点, 百度智能云已实现昆仑芯三万卡集群的点亮。去年11月举行百度世界大会期间, 百度智能云表明还会持续拓展集群规模, 往后将目标朝着百万级情况予以推进。当算力规模跨越万卡朝着更高层级迈进时, 挑战从“是否拥有算力”转变为“能否有效运用算力”。针对于大规模的模型训推需求来看, 于高并发以及高负载的状况之下, 维持可预期的性能展现是极其关键重要的。在最上层, 将那些分散于芯片、超节点与集群层面的能力, 在百度百舸AI计算平台上进一步予以整合、放大, 并且以云服务的形式进行高效输出。据悉, 百度百舸5.0深度适配昆仑芯, 同时支持多款国内外主流芯片, , 在超大规模集群上有效训练时长超95%, 从结果看, 其在异构算力调度和集群稳定性方面颇为成熟。不只是稳定性, 百度百舸定位为面向大模型训推一体化的AI基础设施, 能凭借领先的AI工程加速能力, 覆盖企业在模型开发、训练、部署及推理的全流程需求, 为AI落地提供高效易用的服务。这种具备多维度特性、拥有全栈式特质的能力建设, 显著增强了针对客户多样化、呈现复杂化态势的AI需求的支撑能力, 当前, 百度智能云已经为超过65%的央企提供了服务, 为全部系统重要性银行提供了服务, 为95%的主流车企提供了服务, 为一半以上的头部游戏公司提供了服务, 还为众多走在前沿位置的具身智能企业提供了服务, 而这些有着对稳定性、存有安全性以及讲求效率要求极高特点的客户, 用实实在在的资金送出了信任票。这么讲吧, 研发居首、底层自主研发这般长期主义理念, 又一次借着百度智能云的全栈优势得以证实。于技术复杂领域, 不存在便捷之道。只有坚守底层自主研发、系统思维以及工程落地这三者融合, 方可构建起切实难以突破的竞争屏障。现今处于市场份额首位, 从根本上来说, 就是对这条路径已然可行作出的有力证明。回首站在产业演进那个层级俯瞰, GPU云的竞争早就已然越过了技术参数以及市场份额的那种浅层次的比拼, 而是在于, 能否身为各行各业迈向智能化转型的那个可靠的基础。模型智能愈益提升, 大规模推理需求对GPU云提了更高要求, 各个行业正把AI融入业务流程之内, 具身智能、AI Agent等新兴应用的发展, 鉴于此对AI基础设施提了更苛刻需求, 这并非仅是峰值算力, 还涵盖低延迟响应、高通信效率、确定性调度以及长期可用性。历经过去好几年, 大模型从实验室迈向工厂, 又走向电网, 还走向银行, 且走向汽车生产线。然而当AI从“试验性能力”步入“业务基础设施”阶段时, 产业侧所提出的要求产生了本质性的变化。身为产业方面的客户, 一直真正所需求的, 可不单单只是寻求最强能力的算力, 而更加是那种具备着稳定特性、拥有安全保障、呈现出可预期发展态势以及有着可负担属性的智能方面的服务。他们根本没办法去耐受因为调度出现抖动从而致使训练过程中断的情况, 也绝对不能够去接纳因为有着芯片断供的状况进而使得业务陷入停摆的局面, 而且更是难以去承担那种高昂程度并且还具备不可控特征的推理成本。就是在这样一种现实存在的需求面前, 单纯只是一味地堆砌着英伟达GPU的那种“快餐式”的方案, 明显可以看得出显得力不从心。就算硬件方面的能力特别得强, 要是缺少底层之间的协同配合以及长期以来不断演进的能力, 终究是很难去支撑产业处于级别AI的持续不断运行态势的。在这一现实约束的状况下, 国产GPU云的纵深价值得以显现了, 云厂商要借助从芯片到超节点, 接着到集群以及云服务的全栈布局, 去构建高度相互协同、具备自主可控性质的AI基础设施系统。这样的系统性能力, 不但降低了大规模AI应用的工程门槛, 还使得企业在面对快速演进的技术环境之际, 拥有了更强的适应能力与确定性。拿百度天池超节点来说, 它能把单卡性能提升百分之九十五, 在单实例推理性能方面提升到高达八倍华为昇腾910B的FP16运力达到二百五十六, 寒武纪思元590在边缘的终点推理能够跑出一百二十八TOPS。这些性能方面的优势致使国产芯在实处方面的运用中表露出强大的竞争力。实际的业务情形內, 国产的AI云计算已然深切地融合到产业当中, 百度的智能云计算把昆仑芯P800当作核心, 联合百度的百舸AI计算平台5.0, 给招商银行给予高效且稳定的算力供给支持, 促使大模型在金融场景里的深度运用得以推进百度智能云与长安汽车共同构建长安汽车智算中心, 为深蓝汽车等正在销售的全系车型供给实时推理算力资助, 总算力的规模已然超过。对企业以及创业者来讲, 挑选GPU云, 实际上是于挑选往后数年AI发展的根基。从自行研发芯片, 至超节点算力构建, 再到云平台层面的统一调配与服务供应, 这般纵向一体化能力, 决断了这个根基是不是稳固、可控、可持久。它削减的不单单是技术关口, 更是产业于运用AI进程里遭遇的不确定性花费。历经全栈优化、拥有长期演进能力的基础设施, 不但可支持当下模型训练以及推理需求, 还可为未来架构升级、成本优化以及业务创新留出空间。底座越是稳固, 底层加持越是明显, 于应用层与模型层构建的差异化优势就越不容易被复制。更为关键的是, 这样的自研途径给中国产业留存下了技术主动权, 在全球供应链极具不确定性的大背景之下, 一个能够同时掌控国产芯片与国际硬件还能够达成高效调度的平台这表明企业无需在安全跟性能之间进行那种令人苦恼的抉择, AI 借此切实从可选项转变为必选项。所以, GPU云的竞争最终结局, 并非是资源规模的单纯较量, 而是系统效率跟长期价值的抗衡。在这场比拼耐力、比拼深度、比拼工程定力的长跑赛事里, 真正能把算力转变为稳定生产力的那一方, 才有希望笑到最后, 撑起最广阔的产业未来。