第三颗芯片DPU:海外占七成,国产冲IPO

第三颗芯片DPU:海外占七成,国产冲IPO

英伟达最新的Vera Rubin平台一共6颗主力芯片,其中2颗是DPU——按英伟达2026年CES的口径,BlueField-4全功能DPU和ConnectX-9同属DPU类。放到八卡AI服务器里,GPU和AI DPU的配置比是1比1。而2025年,中国这个市场做了497.58亿元。在对外销售的独立DPU市场里,英伟达等海外厂商拿走了七成以上。

一颗过去被当成"网卡升级版"的芯片,现在站到了CPU和GPU旁边。9月18日,深圳云豹智能更新了创业板IPO招股书,拟募资30.35亿元,估值142.73亿元——"国产DPU第一股"正在冲IPO。

这颗芯片到底干什么

DPU全称Data Processing Unit,数据处理器。它的定位不是加速计算,而是加速数据。

在没有DPU的年代,服务器上跑的是标准网卡,VPC网络虚拟化、云盘读写、安全隔离、虚拟化管理这些活全压在主机CPU身上。行业里常说的"数据中心税",指的就是这部分被基础设施任务吃掉的主机CPU开销,公开口径给出的量级在20-30%。

DPU要做的就是把这些活从CPU上扒下来,搬到专用硬件上。

卸载方向

具体任务

解决什么问题

网络

VPC Overlay、OVS/vSwitch、RoCEv2/RDMA、VXLAN/GENEVE、大象流多路径、拥塞控制

虚拟交换转发延迟降低90%

存储

NVMe-oF、Ceph后端加速、virtio-blk、压缩与加密、本地盘虚拟化

云盘IO与压缩加密从CPU移到硬件引擎

安全

IPsec/TLS、国密SM2/3/4、微分段隔离、DDoS防护、零信任

多租户隔离从软件隔离变成硬件隔离

管理

BMC管控、热迁移、固件验签、可观测性、热升级

热迁移停顿缩短90%,运维动作不抢业务CPU

上表中的量化为厂商与行业研究口径(云豹智能招股书等),不同实现差异较大,仅作量级参考。

说白了,DPU干的是数据搬运的活:数据在哪里,就在哪里处理,而不是把数据先搬到CPU门口排队。

2026年的转折:从省CPU到喂GPU

DPU讲了五六年,第一版故事一直是省CPU——把虚拟化开销省下来,多卖几个vCPU给客户。这个故事在通算场景成立,但算账的时候云厂商发现,自研一颗芯片的钱够买好几年网卡。

真正把DPU推上台面的是AI集群,而且换了一套完全不同的逻辑。

GPU集群里,主机CPU基本无事可做,瓶颈从计算挪到了通信。上千卡、上万卡的训练集群,GPU之间要跑AllReduce、AllGather、ReduceScatter,一旦网络拥塞或者丢包重传,整集群都在等。DPU用RDMA硬件加速、多路径负载均衡、可编程拥塞控制把这些开销接过去,把GPU从通信里解放出来。集群规模越大,这几步的通信耗时占比越高,它也是MFU打折的主要来源之一。

老一代的做法是RoCEv2配DCQCN加PFC。PFC的毛病在于它会反压,一条流的扇出就能把整个上行端口堵死,PFC风暴一旦起来,整张网跟着抖。这也是为什么大厂都在往多路径加自研拥塞控制上走:阿里云的eRDMA主打多路径与自研拥塞控制,AWS的SRD干脆自己写了一套协议栈。这项能力的水平,直接决定了千卡集群的实际可用算力。

另一件更值钱:管KV Cache。

大模型推理时,上下文越长,KV Cache膨胀得越厉害。Agent、长文档、多轮对话把上下文从几万token推到几十万甚至上百万token,KV Cache成了新的内存墙。DPU的价值在于,它能在GPU内存和下面的存储之间架一个独立、高速、可共享的记忆层,让上下文数据就近存放、按需搬取,而不是每次都从远端存储拉一遍。业界实测口径显示,走DPU直通路径相比CPU中转,可以把KV Cache的搬运延迟压到毫秒级,具体数值随链路速率与并行度差异很大。

收益有论文层面的数据。FlowKV(arXiv 2504.03775)测到KV Cache平均传输延迟从0.944秒降到0.053秒,改善约94%(论文摘要口径为96%)。从秒级掉到几十毫秒,对长上下文推理的吞吐影响是直接的。

顺带解释一个容易搞混的地方:AI DPU和全功能DPU是两类产品。AI DPU只做网络,没有自己的CPU核,也不挂独立内存,专门吃GPU集群的Scale-out流量;全功能DPU要跑Linux、要管虚拟化和存储,所以得配上独立的CPU核和DDR内存。内存涨价对BOM表的影响,说的是后者,下一节展开。

云厂商全在自研,但第三方市场没消失

五大云厂商的DPU都是自用,不作为独立商品对外卖芯片和卡。

厂商

产品

起步

当前带宽

芯片方案

RDMA方案

对外销售

AWS

Nitro v5/v6

2017年

200-400G

自研ASIC

SRD(自研,需改代码)

否

微软

Azure Boost DPU

2024年

400G

自研ASIC+FPGA

规划中

否

Google

Titanium + Intel IPU

2023年

200G

Intel合作ASIC

RoCEv2

否(与Intel联合开发,仅供自家C4/N4)

阿里云

CIPU

2017年神龙/2022年CIPU

400G

自研

eRDMA(标准VERBS)

否

腾讯云

银杉/玄灵

2021年起

400G

自研玄灵+投资云豹

—

否

Google这行有个注脚:2026年4月9日,Intel和Google签了多年协议,在Google Cloud的C4、N4实例上部署Xeon 6和基于定制ASIC的IPU,官方说法是能把20-30%的主机CPU周期还给应用。这批IPU是联合开发、给Google自家用的,公开材料里没有对外供货的表述。

云厂商全自研,听起来像第三方厂商没饭吃。但中信证券2026年8月的研报给了个反面结论:海外市场里,除了亚马逊保持全自供,多数厂商仍然以第三方供给为主,AI数据中心场景尤其如此,核心是英伟达的BlueField和ConnectX、博通的Thor。

原因简单——自研只算得过自己的量。私有云、混合云、运营商云、行业云这几块,量撑不起一颗芯片,只能买。

一颗400G全功能DPU,卖多少钱

价格是理解这个市场的另一把尺子。

产品

速率

价格

口径

ConnectX-7

400G

约1000美元

大厂拿货价

ConnectX-8

800G

约1500美元

大厂拿货价,代际涨幅约50%

BlueField-3

400G

存储涨价前2000-3000美元,涨价后接近4000美元

海外市场估计

BlueField-4

800G

未公布

—

国产对标产品

400G

较国际大厂主流产品有七八成折扣

中信证券

价格一栏的来源是中信证券2026年8月研报。国产那行按研报原话是"国产对标产品价格通常较国际大厂主流产品有7~8成折扣",折扣的具体含义(是售价为对方的七到八成,还是降幅七到八成)原文没写透,量级上就是明显更便宜。

BlueField-3这行值得单独说一句。芯片本身没变,价格被内存顶上去了一截——全功能DPU上挂着独立的DDR内存,DDR5每GB价格从2023年的三四美元涨到2026年上半年的十几到二十几美元(PC模组与服务器RDIMM口径差异较大),卡上的内存成本跟着翻了几倍。全功能DPU是这轮存储涨价里少数几个被直接顶到BOM表上的芯片。

量怎么算,中信证券给了个配置比例:八卡服务器里,GPU和AI DPU是1比1,和全功能DPU是8比1;超节点服务器里,GPU和AI DPU还是1比1,全功能DPU是4比1。按这个口径,2028年国内AI DPU的配套空间约414亿元,全功能DPU约498亿元,合计912亿元。

国产三家:一个冲IPO,一个量产,一个融钱

第一梯队的位置其实很清楚。沙利文在《2026年中国DPU市场独立研究报告》里写:在中国独立全功能DPU市场,英伟达占据市场首位,云豹智能排名第二,同时在本土独立全功能DPU厂商中位列第一。海外厂商整体在中国的份额超过70%,国产不到30%。

云豹智能是三家里唯一递表的那家。创始人萧启阳是斯坦福博士,公司6月30日拿到创业板第四套标准的IPO受理,9月18日更新招股书。几个数字:截至2026年8月末DPU产品累计销量突破13万颗,2026年前三季度营收预增超900%,三年营收从2023年的17万元做到2025年的3.7亿元,本轮估值142.73亿元,拟募资30.35亿元。产品端,云霄1.0系列用的是RISC-V加Arm v9的混合架构,64个自研RISC-V多线程核加上16个Arm Neoverse N2核,400Gbps全功能DPU,2024年下半年量产,招股书口径是对标英伟达BlueField-3。中国移动基于它的芯片发布了大云"磐石4.0""智算琢光""灵耀"三款DPU产品,中国联通2025年首发"大衍"DPU。

招股书里也写了风险:2026年上半年腾讯直接及间接贡献的收入占比97.86%,2023到2025年累计亏损24.66亿元,公司预计最早2028年才能盈利。

中科驭数走的是另一条路。这家2018年成立、创始团队来自中科院计算所的公司,2026年8月完成数亿元C+轮融资,投前估值约50亿元、投后近70亿元。K2-Pro按2026年公司口径标称80Mpps网络卸载、75TOPS AI推理、400G互联、50M QPS数据库加速;下一代K3计划2026年量产,指标翻到160Mpps、150TOPS、800G互联、100M QPS。

云脉芯联主攻AI网络。2025年11月完成超5亿元A轮,上海科创集团领投。第一款芯片YSA-100是国内首颗支持400Gbps吞吐的RDMA高性能网络互联芯片,2024年初点亮、同年正式量产并出货,支持25GE到400GE接口,带vSwitch卸载,目前已在头部互联网和运营商客户量产出货。

三家加起来的营收,跟英伟达一家在中国DPU市场的收入相比,还是小数字。但路径是清晰的:先靠400G在国产替代窗口里拿下云厂商和运营商,再往800G和AI DPU上爬。

差距不在硬件,在软件

国产DPU和英伟达最实在的差距,不在纸面参数上。

从指标看,400G这一代,云豹云霄1.0已经在处理器性能、网络带宽与可编程性上对标BlueField-3(招股书口径)。真正的门槛在软件,而且要分成两层看。

一层是兼容性及格线:驱动、配套软件栈、DDK、主流云平台适配、生态认证。这一层做不好,客户连测试机会都不会给。

另一层是场景纵深:智算集群的多路径拥塞控制、KV Cache管理的API开放程度、微分段和高性能存储的对接深度。这一层才是可能拉开差距的地方。

英伟达的做法是把DPU写进自己的全家桶。2026年3月GTC首发的BlueField-4 STX是个面向agentic AI存储的参考架构,配DOCA软件栈;英伟达5月底的发布稿里给的官方数据是,运行时威胁检测比传统无代理方案快最高1000倍,网络与文件访问强制做到最高800Gb/s。芯片只是入口,DOCA把客户锁在里面。

还有一点值得留意:这一轮国产替代的替换对象,正在从云厂商自研的FPGA网卡,转向海外400G及以上主流产品。这意味着客户对软件成熟度的要求会高一个量级。

三句话:DPU的定义已经变了,从省CPU的网卡,变成AI集群里管数据和记忆的芯片。更大的需求来自云厂商全自研之后剩下的私有云、运营商云和行业云,这部分只能靠第三方供应。国产第一梯队已经能把400G做出来、卖出去,接下来三年的胜负手是软件生态,不是流片。

留一个开放的问题,2028年回头看:当800G AI DPU成为标配、每台八卡服务器都要挂的时候,中国这个市场里国产能不能从不到30%爬到一半。云豹的招股书给的时间表是2028年盈利,那一年,也正好是中信证券测算的国内912亿元市场空间落地的那一年。

欢迎关注公众号:阿水助理小Q,每日带来一篇高质量的AI基础设施产业调研的技术洞察或关键部件分析报告。