燧原科技启动科创板发行:DSA路线跑出万卡集群,26年半年营收突破11亿元

<{$news["createtime"]|date_format:"%Y-%m-%d %H:%M"}>  财中社 徐钱诚 1.6w阅读 2026-08-28 13:34
燧原科技正式启动科创板发行,在DSA架构、TopsRider软件栈和万卡集群等全栈能力支撑下,公司正切入推理需求加速增长、国产算力替代和AI加速卡市场持续扩容的行业窗口。

8月24日晚,上海燧原科技股份有限公司(简称“燧原科技”)披露招股意向书及发行相关公告,正式进入科创板发行阶段。本次拟公开发行4303.52万股,占发行后总股本的10%,预计9月2日进行网上、网下申购。

对于一家云端AI芯片公司而言,燧原科技这次发行的一个重要背景,是AI算力产业本身正在发生变化:竞争焦点已经不再只是单颗芯片的峰值算力,而是从芯片架构、软件生态、高速互连,到服务器、超节点乃至万卡集群的系统能力。

这恰好也是燧原科技过去八年逐步拉长的产品链条,公司成立于2018年,迄今已自研迭代四代架构、5款云端AI芯片,并形成AI芯片、AI加速卡及模组、智算系统及集群、AI计算及编程软件平台的完整产品体系。

不走GPGPU路线,四代五款芯片押注DSA架构

从技术架构来看,燧原科技并不是传统意义上GPGPU厂商,而是从成立之初便押注面向AI计算优化的DSA路线。

目前云端AI芯片主要存在GPGPU和DSA两条路径。DSA是把更多芯片面积和晶体管资源用于AI专用加速单元,提高特定计算领域的效率。燧原选择的是在AI计算这个领域内部保持可编程性和通用性:既能够伴随算法和模型持续迭代,又把更多硬件资源集中于矩阵计算、数据搬运和高速互连等AI负载最需要的环节。谷歌TPU、亚马逊Trainium、华为昇腾、昆仑芯以及寒武纪等均属于DSA架构的AI芯片。

落实到硬件上,燧原基于自主指令集研发了GCU-CARE加速计算单元和GCU-LARE片间高速互连技术,分别对应AI矩阵计算和多芯片高速通信两个核心环节。公司最新第四代架构已经原生支持FP8低精度计算,并支持万卡及以上集群;第三代产品则采用Chiplet方案实现两颗芯片同构合封。公司披露,自成立以来四代架构、5款芯片均实现一次流片成功。

燧原科技的产品迭代路线也非常清晰:2019年的邃思1.0、2021年的邃思2.0和2.5,随后是2024年的邃思320,以及2025年发布的第四代邃思400。最新一代训推一体加速模组支持FP8、多卡高速互连及万卡以上集群,开始从过去相对独立的训练、推理产品向“训推一体”演进。

对于燧原科技来说,在当前这个推理需求爆发的时代,选用DSA架构的价值进一步得到体现。随着大模型应用从训练走向大规模调用,客户关注的指标正在从“能不能训练”进一步转向单位Token成本、吞吐量、时延和能耗。行业分析认为,推理场景对于CUDA生态的依赖正在下降,算力性价比和能效比的重要性上升,而DSA能够针对AI负载进行专门优化,这为其扩大市场份额提供了新的窗口。

不过,对国产AI芯片而言,硬件只是第一道门槛。真正决定一颗芯片能否进入客户生产环境的,往往是软件。燧原没有基于CUDA,而是从底层驱动、编译语言、编译器、算子库到开发工具链,自研了TopsRider软件栈,其中Tops C++编译语言及编译器,具备高效、易用和便于CUDA程序迁移的特点。截至招股意向书签署日,公司已经提供约1600个优化算子,并支持PyTorch、TensorFlow、vLLM、SGLang、Megatron-LM、DeepSpeed等主流框架及推理引擎。

也就是说,燧原所试图建立的不只是“一颗芯片”的竞争力,而是硬件架构、编译器、算子库和模型适配共同构成的全栈能力。

加速卡持续放量,从单卡销售走向万卡集群

AI芯片公司最难跨过的一道门槛,在于从产出芯片走到客户真正大批量采购。

从招股意向书披露的数据看,燧原已经明显进入产品放量阶段。2023年至2025年,公司AI加速卡及模组总销量分别达到2.47万张、3.80万张和6.63万张,2025年产量达到7.42万张,产销率为89.44%。如果只看直接形成该业务收入的AI加速卡及模组,2025年销量为6.49万张,同比增长197.81%;对应销售收入8.56亿元,同比增长178.46%,占当年主营业务收入的86.83%。

公司解释称,增长主要来自第三代AI加速卡在互联网客户AI业务场景中的持续放量。2025年,公司对腾讯科技(深圳)的销售收入达到7.68亿元,占当年营业收入的74.90%,主要销售AI加速卡及模组。

对于AI芯片厂商而言,互联网客户的意义不仅是贡献收入。大规模搜索、推荐、语音、内容生成以及大模型推理业务通常具有高并发、长时间稳定运行等特点,产品一旦能够进入这类核心业务场景,也意味着芯片、软件栈以及运维能力都经过了实际生产环境检验。

目前燧原硬件已经适配近千个AI模型,覆盖互联网和非互联网领域超过300个应用场景;公司与超过100家AI产业链上下游企业建立生态合作,并与20余家软件技术合作伙伴协同完善算子库、编程模型和上层软件栈。

相比单卡销售更值得关注的,是燧原已经把产品边界继续延伸。公司2022年即推出智算集群产品,目前千卡、万卡智算中心项目均已实现收入。2024年底,其在“东数西算”甘肃庆阳节点建成国产万卡推理集群,该集群后来成为国内首个获得中国信通院大规模智算集群服务成熟度五星级认证的国产万卡推理集群。

另外,第四代产品进一步开始进入“超节点”阶段。燧原基于第四代产品推出OGX400,并开发ESL32/64超节点,后者单节点可集成32张或64张加速卡,通过RoCE实现大规模跨卡、跨节点通信,面向大模型预训练和高并行推理场景。

这背后的行业逻辑是,当模型参数量达到千亿甚至万亿级以后,单颗芯片的峰值算力已经无法独立决定整体性能,芯片之间能否高速通信、数千张乃至数万张卡能否保持较高的线性扩展效率,开始决定最终能够交付多少“有效算力”。

从这个角度看,燧原从芯片走向加速模组、POD、超节点和万卡集群,并不是简单扩大产品品类,而是在沿着产业竞争重心从单颗芯片向系统层级延伸。

推理市场前景良好,DSA份额有望提升

燧原科技发行的另一个背景,是AI算力市场仍处于高速扩容阶段,而且需求结构正在发生明显变化。

灼识咨询数据显示,全球AI加速卡市场规模预计将从2024年的超过1000亿美元增长到2028年的超过5000亿美元,期间复合增长率超过40%;同期中国AI加速卡市场预计超过1万亿元,占届时全球市场约30%。

其中,推理可能成为更大的增量市场。招股意向书中援引的预测表示,中国训练用AI加速卡市场到2028年预计达到2990.64亿元,而推理用AI加速卡市场有望达到8085.82亿元,占整体市场的比例超过70%,2024年至2028年,推理市场预计仍将保持59.41%的复合增长速度。

推理占比上升,对芯片竞争规则也会产生影响。训练侧更看重峰值算力和大规模并行能力,推理侧则更关注算力使用成本,随着大模型调用量持续上升,芯片的能效比、吞吐量以及单位Token成本,都会直接影响客户的算力支出。这也是DSA路线可能获得增量空间的原因之一,高盛全球投资研究部预测,在AI服务器所使用的AI芯片中,非GPGPU即DSA架构的出货占比,可能从2024年的36%上升到2027年的45%。

在推理市场放量的同时,大模型推理本身也正在变得更加复杂。招股意向书指出,大模型运行的预填充和解码阶段对硬件的要求并不相同:预填充属于计算密集型场景,芯片算力是核心指标;解码则更偏内存密集型,显存容量和显存带宽对性能影响更大。这意味着,随着推理占比持续提升,AI芯片的竞争指标也在进一步细分,单一峰值算力已经越来越难以完整衡量实际推理性能。

另外,MoE等大模型架构的普及还在改变推理集群的运行方式。招股意向书提到,专家并行、参数解耦以及PD分离等新型推理架构,正在成为提升MoE模型推理效率的重要技术路径,其核心是把不同算力特征的任务拆分后交给不同节点并行处理。由此来看,推理需求的增长不仅意味着AI加速卡需求增加,也在推动芯片、显存、高速互联和集群调度之间形成更深的协同。

与此同时,中国市场的需求还具有明显的“头部化”特征。招股意向书援引BERNSTEIN预测,到2028年,字节跳动、阿里巴巴和腾讯三家企业的AI资本开支可能占中国AI资本开支的近50%。

这意味着,国产AI芯片企业未来几年最核心的竞争之一,是能否真正进入头部互联网厂商的供应体系,并伴随客户资本开支一起增长。燧原科技此前已经在互联网场景实现多代产品规模化应用,同时招股意向书显示,公司还已进入运营商和头部行业客户的采购体系,其商业化边界正从互联网进一步向运营商及行业市场扩展。

26年半年收入超过去年全年,60亿元投向下一代产品

技术投入的成功最终会体现在收入曲线上。

2023年至2025年,燧原营业收入分别为3.01亿元、7.22亿元和9.90亿元,三年复合增长率达到81.32%。进入2026年后,放量速度进一步加快,2026年上半年,公司实现营业收入11.20亿元,同比增长279.08%,仅半年收入就已经超过2025年全年;其中第二季度单季收入8.33亿元,同比增长200.50%。此外,公司预计2026年前三季度营业收入将达到23亿元至30亿元,对应同比增长325.78%至455.36%。

收入增长的同时,产品迭代也在改善收入结构。2023年至2025年,公司主营业务综合毛利率由22.60%提高至31.78%,其中第三代产品量产后成为2024年和2025年的主要销售产品,较第二代产品拥有更高的性价比和更广泛的模型适配能力。

支撑其产品持续迭代的是高强度的研发投入。2023年至2025年,公司研发费用分别达到12.29亿元、13.12亿元和11.35亿元,三年合计36.76亿元;截至2025年底,公司838名员工中有643名研发人员,占比76.73%,其中461人拥有硕士及以上学历。

此次IPO募资,燧原科技将继续向下一代产品及软硬件协同创新项目发力。

从募集资金投向看,燧原希望延续的仍是过去几年已经形成的“芯片—软件—系统—集群”技术路线,而不是单纯追逐单芯片参数。

对于整个国产AI芯片产业而言,模型快速迭代以后,硬件架构需要持续适应新的计算精度和算法结构;进入大规模部署后,软件迁移成本决定客户愿不愿意使用;走到万卡时代,互联效率、调度能力和系统稳定性又决定了芯片能不能真正形成有效算力。

燧原此次启动科创板发行,其更值得关注的地方也正在于此:从四代架构、五款芯片,到TopsRider软件栈,再到互联网大客户、超节点和万卡集群,公司已经完成了从“单颗芯片”向“系统集群”的延伸。而在国内AI加速卡市场向万亿元规模扩张、推理需求成为新增量的产业背景下,伴随着燧原五代、六代产品的落地,其接下来的成长空间,将越来越取决于这套全栈技术体系能够转化出多大的商业价值规模。


重要提示:本文著作权归财中社所有。未经允许,任何单位或个人不得在任何公开传播平台上使用本文内容;经允许进行转载或引用时,请注明来源。联系请发邮件至editor@caizhongshe.cn。

最新文章推荐

长按保存图片