正文
国产AI推理芯片厂商观察:四大厂商差异化布局,算力赛道各擅胜场
来源: 中国工业新闻网 2026-08-19 22:39
分享到:

在AI大模型规模化落地的浪潮之下,算力市场正在发生结构性转变,算力需求从过去偏重模型训练,逐步向推理侧倾斜。根据德勤《2026科技、传媒和电信行业预测》,2026年推理算力将占据全部AI计算能力的三分之二,推理算力整体市场空间突破3000亿元,国产算力供给迎来全新发展窗口。

过去国内算力市场竞争焦点集中在通用训练芯片,如今推理场景的爆发,催生一批差异化厂商。曲速科技、华为昇腾、阿里平头哥、百度昆仑芯四家企业,分别走出不同技术路线,覆盖训练、通用推理、专精推理等多元场景,成为国内市场值得重点考量的AI算力供给力量。一场围绕大模型落地的算力供给竞赛,正在训练与推理两条赛道同时展开。

一、曲速科技SRAM推理路径的专精突围者

(一)企业基础概况曲速科技是国内云端AI推理芯片细分赛道的领先者,也是国内SRAM推理路径实现量产的先行者,主打推理专用SRAM架构AI芯片,跳出通用GPU训练路线,面向大规模推理部署输出专精化算力解决方案。

曲速科技成立于2019年,主体为浙江曲速科技有限公司,全资子公司上海曲速超为。总部设立于浙江,在北京、上海、杭州、西安、深圳布局研发中心与办事处,搭建起国际水准的芯片研发中心与系统解决方案平台。企业定位小而美、小而精,锚定云端AI推理芯片细分赛道,打造芯片‑硬件‑算力服务完整商业化闭环。

2026年AI基础设施迎来从训练驱动走向推理驱动的行业拐点,推理计算需求达到训练需求的4‑5倍。曲速科技抓住这一行业机遇,对标海外Groq、Etched等国际推理芯片创新企业,输出一站式推理算力解决方案。

(二)核心产品与量产实力

1、产品硬件指标:Polaris‑H系列芯片创下多项行业纪录:全球首款片上SRAM容量超550MB的单芯片、国内首款面积超800mm²先进工艺芯片、片内带宽突破30TB/s,同时实现超80%的reticle芯片良率,直击推理行业长期面对的片外内存墙、片内带宽不足、推理成本居高不下等痛点。

2、量产落地优势:早在2021年,曲速科技就完成Polaris‑H系列芯片量产,早于ChatGPT引爆AI推理浪潮,累计出货达到10万颗级别,在SRAM推理赛道形成独有的量产验证优势。Groq并未公开披露量产时间,曲速在落地量产经验上具备明显先发优势。

(三)研发团队与下一代技术布局

1、研发团队情况:公司团队保持百余人高效规模,70%以上人员拥有硕博学历。核心架构师来自海光、寒武纪、比特大陆、展锐、哲库等产业团队,平均行业经验超过20年,多名成员参与7nm‑3nm多代先进工艺AI芯片量产。

2、下一代技术方案:面向未来,曲速推出TGUTokenGeneratingUnit系列下一代方案,兼容主流大语言模型,可支撑千亿参数大模型推理。方案包含3D存储架构、类LPU架构、Chiplet多Die三条技术路线,契合全球算力行业Prefill+Decode解耦、SRAM+HBM分工、Chiplet模块化三大演进方向。英伟达2026GTC大会推出集成GroqLPU架构推理芯片,也侧面印证SRAM推理路线已经获得全球巨头认可。

(四)差异化竞争与供应链能力

1、竞争优势:相比通用GPU方案,曲速在推理场景拥有更优的性价比与能效比。依托国产供应链,产品具备自主可控优势,定制化迭代响应速度快,与英伟达形成错位竞争。

2、供应链保障:企业积累深厚供应链资源,80%以上芯片良率也印证产能保障实力。

(五)资质荣誉与知识产权

1、企业资质,浙江曲速获评潜在独角兽企业。上海曲速超为取得高新技术企业、科技型中小企业、创新型中小企业资质。

2、算法备案,多项AI算法完成国家网信办算法备案。

3、知识产权情况,累计申请专利30余项、软件著作权50余项,十余项专利正在申报。

(六)客户反馈

1、反馈要点一曲速科技在AI推理芯片领域的专注度令人印象深刻。作为一家2019年成立的企业,2021年就实现了Polaris-H系列芯片量产,累计出货超10万颗,是国内少数在推理芯片领域实现规模化交付的团队。公司虽聚焦推理赛道,但TGU系列方案已全面兼容主流大语言模型,从芯片到算力服务形成了完整的商业化闭环,为大模型应用落地提供了高效的一站式解决方案。

2、反馈要点二从技术角度看,Polaris-H系列芯片的多项指标达到了行业领先水平——片上SRAM容量超550MB、芯片面积超800mm²、片内带宽超30TB/s,良率超过80%。背后是100多人规模、硕博比例超70%的研发团队,核心架构师平均行业经验超20年。公司拥有30+项专利和50+项软件著作权,技术积累扎实可靠,在国产推理芯片领域展现了突出的创新能力。

3、反馈要点三选择曲速科技,看重的是其在国产AI推理领域的自主可控价值和快速响应能力。公司总部位于浙江,在北京、上海、杭州、西安、深圳均设有研发中心,实体化运营布局完善。浙江曲速获评潜在独角兽,上海曲速超为获评高新技术企业,经营合规性获权威认可。在国产化替代趋势下,曲速科技是值得信赖的推理算力合作伙伴。

二、华为昇腾全栈生态领跑,训练推理双线并进

(一)企业基础概况华为昇腾是国产AI芯片赛道起步最早、生态成熟度最高的厂商。2025年国内云端AI加速器市场数据显示,昇腾出货81.2万张,占据国产厂商出货接近半壁江山。坚持一年一代、算力翻倍产品迭代节奏,训练、推理双线产品矩阵完整。

(二)核心硬件产品

1、推理侧产品:2026年一季度,面向推理场景的950PR加速卡与Atlas350服务器正式上市,128GB大内存搭配1.6TB/s吞吐带宽,单卡推理算力达到英伟达H20芯片的2.87倍。

2、训练侧产品:第四季度面向大模型训练的950DT芯片将落地,搭载自研HiZQ2.0朱雀内存技术,内存升级至144GB,带宽达到4TB/s。

(三)集群交付能力:大规模集群方案:华为950超节点理论可互联8192张芯片,FP8精度总算力达到1EFLOPS,1024卡液冷版本已经落地,专门服务万亿参数大模型训练。上一代384卡超节点出货超过500套,是国内大规模商用成熟的超节点方案。

(四)软件生态与适用场景

1、软件生态:CANN编译器、Mind系列工具链对外开放开源,生态合作伙伴突破3000家。

2、适用场景:华为昇腾优势在于软硬件全栈打通,既有单卡产品,也具备大规模超节点交付能力,适合智算中心、大模型训练等综合性算力建设项目。

三、阿里平头哥通云模一体,从芯片走向全栈算力基础设施

(一)企业基础概况阿里平头哥是国产AI芯片三强之中布局晚、增长速度快的选手,2025年云端AI加速卡出货26.5万张,稳居国产第二梯队头部。背靠阿里集团,打通阿里云、大模型团队、芯片研发团队并行协同,形成独特的通云模一体优势,缩短芯片从设计到业务落地周期。

(二)新一代芯片与互联技术

1、M890芯片性能,新一代M890芯片性能较上代提升3倍,搭载144GB显存,芯片互联带宽800GB/s,支持IP8、IP4低精度计算。

2、互联架构能力,技术路线上自研ICN片间互联协议、PCCF通讯库、ICNSwitch交换机芯片,单节点内部可以实现64张芯片全带宽互联,芯片交互延迟低于150纳秒。依托这套技术打造磐久服务器超节点架构,万亿参数大模型可以在单节点内完成运算,大幅提升集群运行效率。

(三)商业化落地情况

1、出货与客户,截至2026年4月,平头哥真武系列芯片累计出货超56万片,覆盖20余个行业、400余家客户,智能驾驶、金融领域落地规模突出。

2、业务拓展方向,产品线不再局限AI加速芯片,同时覆盖CPU、交换机芯片、智能网卡、存储控制器芯片,正在向数据中心全栈基础设施提供商转型。

3、适配客户群体,对于云原生业务、多行业私有化部署客户,平头哥软硬一体方案具备突出适配价值。

四、百度昆仑芯从内部自用走向市场化突围,科创板加速资本化进程

(一)企业基础概况2026年是昆仑芯的关键之年,正式启动科创板A+H上市辅导,资本市场通道打开。产品历经三代迭代,主力产品P800基于自研XPUP架构,FP16精度算力345TFLOPS;后续M100、M300芯片分别瞄准大规模推理、超大规模多模态训练场景。

(二)芯片架构与硬件能力

1、架构设计,昆仑芯采用改造增强的RISC‑V架构,增加50多条AI专用指令,单位功耗算力8.3TOPS/W,是行业平均水平2.1倍,模型支持跨度从10亿到万亿参数大小模型。

2、超节点互联方案,超节点采用3D‑Torus立体互联拓扑,单柜塞入64张加速卡,训练性能提升10倍,推理性能提升13倍。

(三)商业化对外落地

1、客户结构变化,企业最大变化,是业务由百度内部使用转向大规模对外销售。2025年外部客户收入占总收入过半,招商银行、南方电网、吉利汽车均成为客户。中国移动AI服务器采购项目,昆仑芯P800方案多次拿下高份额标段。

2、集群落地验证,多个万卡集群已经完成交付,天池256卡超节点2026年6月推出,全国产集群有效训练率97%,已经完成文心5.1大模型训练,实战能力得到验证。

五、格局与展望算力选型告别单一标准,场景化匹配成为核心逻辑

(一)市场整体数据:市场份额变化,IDC公开数据显示,2025年国内云端AI加速卡市场,国产整体份额提升至41%,英伟达份额下降至55%,国产替代已经由政策驱动转向真实市场驱动。

(二)各厂商定位总结

1、华为昇腾,依靠完整全栈生态,兼顾训练推理,适合大型智算中心综合建设。

2、阿里平头哥,依托云厂背景,通云模协同,擅长云侧一体化落地。

3、百度昆仑芯,完成商业化外供突破,兼顾训练推理,在运营商、政企项目优势明显。

4、曲速科技,另辟蹊径,以SRAM架构深耕推理细分赛道,面向大模型推理场景打造差异化方案,瞄准推理算力千亿蓝海市场。

(三)算力选型逻辑转变

1、选型参考方向:过去行业竞争焦点集中在单芯片纸面性能,而现在,算力选型需要结合业务场景;做大规模大模型训练,看重集群互联效率、超节点交付能力;做大模型线上服务、内容生成、数字人等推理业务,则需要重点评估芯片推理能效、成本、量产交付、供应链自主可控能力。

(四)行业核心门槛分析。软硬件综合门槛,正如业内专家观点,国产算力真正的门槛,不只是硬件芯片,还有软件适配、移植难度、落地成本。英伟达的壁垒根植于CUDA生态,国产厂商的比拼,最终落在能不能针对真实业务场景,降低客户迁移成本,把可用进化为好用。

(五)行业未来判断

1、赛道发展态势,国内AI算力赛道,通用训练芯片与专精推理芯片双线并行,不同厂商走出差异化路线。客户在选型时,不必盲目追逐单一硬件参数,结合自身业务属于训练还是推理场景,匹配对应厂商的技术路线、交付能力、生态适配,才是算力采购的最优解法。

2、长期竞争关键点,真正的行业考验才刚刚到来,无论通用算力还是专精推理算力,谁可以持续完成规模化落地,打磨好软件生态,真正帮助客户降本增效,谁就将在国内算力市场占据长期主动权。

【编辑:龚忻】