Token效率新标尺下,中科曙光scaleFabric以“算存传”三级紧耦合破局
当模型参数大到单卡放不下时,真正决定效率的,已经不只是某一块加速卡的峰值算力,而是数据在算力、网络和存储之间“搬得有多快、等得有多久”。
近期,中科曙光发布了Token加速技术体系,该体系以scaleFabric原生无损RDMA为核心网络传输底座,构建算-存-传三级紧耦合的Token加速超级通道。其中,支持GPU直通网络的IBGDA技术实现在国内的首次规模化落地。
中科曙光高速网络互联产品部总工程师万伟在媒体沟通会上表示,此次发布的scaleFabric Token加速技术体系,以原生无损RDMA为底座,构建算-存-传三级紧耦合的Token加速超级通道,并推动支持GPU直通网络的IBGDA技术进入国内首次规模化落地阶段。
算存传三级紧耦合:scaleFabric的Token加速超级通道
现在的大模型基本都基于Transformer架构,按Token进行处理。因此,Token是当前AI Factory最重要的产出,也是衡量AI效能和经济效益的重要指标。万伟强调,算力、网络和存储三者之间的数据流转效率,是整个AI Factory的关键。
实际上,scaleFabric的核心思路,是以原生无损RDMA为底座,构建算-存-传三级紧耦合的Token加速超级通道,让Token在训练、推理、存储全流程高速流转。
在计算环节,scaleFabric原生支持GPUDirect RDMA,也就是GDR。这是一项基础能力,相当于让网卡直接读写GPU显存,绕过传统路径中由CPU内存中转的一次数据拷贝。传统通信路径中,数据需要从GPU显存拷贝到CPU内存,再由CPU通过网卡发出,接收端则是相反过程。GDR允许网卡直接读取或写入GPU显存,完全绕过主机CPU和系统内存,极大降低了通信延迟并减少了CPU开销。
但GDR并没有解决全部问题。万伟解释,即使采用GDR,虽然数据面绕过了CPU内存,但通信任务的下发和相关元数据处理仍然需要CPU参与。RDMA通信可以分为控制面和数据面,传统GDR主要优化了数据面。IBGDA则进一步把通信控制和数据处理都放到GPU上完成,使GPU Kernel能够直接驱动网卡。
具体来说,IBGDA允许GPU内核直接驱动和控制InfiniBand网卡,使GPU可以不依赖CPU,完全自主地发起和管理节点间通信。其操作流程通常是:GPU内核直接在显存中准备好数据并写入工作队列,然后直接向网卡的门铃寄存器发起写入操作以通知网卡。网卡随后通过GDR技术从GPU显存中读取工作描述符和数据,完成后续的RDMA发送。整个过程从数据搬运到任务下发,全部在GPU上完成。
这样可以进一步降低小消息通信时延。当前MoE已经成为大模型的主流架构之一,通信过程中存在大量并发的小消息传递,IBGDA对这类场景非常重要。让GPU直接发起和管理数据通信,是当前非常重要的技术思路。scaleFabric很早就支持了IBGDA,可以说是国内首批规模化应用IBGDA技术的网络产品之一。
在存储环节,scaleFabric围绕Token的存储访问瓶颈,构建了完整的存储直通技术体系。NVMe over RDMA、XDS和NFS over RDMA三项技术,分别用于加快远端NVMe存储访问、支持GPU直接访问远端存储,以及提升传统文件存储的传输效率,共同打造存储与算力之间的高速网络通道。
其中,NVMe over RDMA主要面向KVCache等需要大量缓存的场景。KVCache通常以块数据形式存储,scaleFabric可以支持这类块数据的直接访问。利用scaleFabric的低时延、无损RDMA网络,计算节点能够高速访问远端NVMe存储,如同访问本地硬盘,存储访问延迟降低80%以上。在KVCache卸载、分布式训练数据读取、推理数据访问等场景中,NVMe over RDMA使存储不再成为Token生成的瓶颈,大幅缩短TTFT。
NFS over RDMA面向文件存储协议场景,将NFS文件存储体系运行在scaleFabric的RDMA高速网络之上,让依赖文件存储的AI训练任务无需改变应用习惯即可获得RDMA加速。其核心原理是:RDMA网卡直接将数据从存储节点的内存传输到计算节点的内存,全程无需CPU介入、无需内核参与、无需多次拷贝,实现真正的“零拷贝”数据高速公路。文档显示,采用NFS over RDMA后,有实践表明可将GPU利用率从约55%提升至95%以上,单轮训练时间减少30%至60%。
XDS即XPU Direct Storage,是面向AI算力集群的加速卡直通存储技术方案。其核心原理是允许XPU,包括GPU、DCU等加速处理器,绕过主机CPU和系统内存,通过RDMA网络直接访问远端存储设备,实现从存储到XPU显存的端到端零拷贝数据通路。数据从存储节点发出后,经RDMA网卡直接写入XPU显存,全程无需CPU介入、无需内核参与、无需多次内存拷贝。XDS与GDS技术路线对等,是存算分离架构下实现“存储直通”的关键能力。
万伟表示,这三项技术会根据场景配合使用,也可以在同一个场景中同时使用。例如,训练数据的顺序加载以及Checkpoint读写,传统上属于面向文件的数据访问,通常可以使用NFS over RDMA。对于其中的热点数据,目前比较前沿的方式是采用Burst Buffer或NVMe高速闪存。此时,NVMe over RDMA可以在热数据缓存场景中进一步提升存储性能。在这一过程中,KVCache卸载和相关数据读写还可以通过XDS,让GPU直接访问远端数据。三项技术是紧密耦合、协同工作的关系。
在网络环节,scaleFabric具备较好的时延性能,转发性能可以对标InfiniBand,单跳转发时延低至260纳秒,端到端时延低于1微秒,与英伟达NDR持平,优于主流RoCE方案。在部分场景的三跳基准时延性能测试中,以4k以上的大消息包文为例,scaleFabric三跳时延较RoCE方案低约63%。同时,scaleFabric基于严格无损的网络协议实现。在大规模组网时,可以避免依赖PFC等方式来实现近似无损,因此扩展到大规模集群时能够尽量避免性能损失。相较于RoCE网络,scaleFabric更适合大规模数据传输。
IBGDA国内首次规模落地:MoE推理时代的关键补位
推理时代,MoE已成为模型主流架构,IBGDA技术的价值进一步凸显。当前主流大模型广泛采用MoE架构。以DeepSeek为例,它通过DeepEP等方式进行专家并行通信,并使用NVSHMEM支撑大规模MoE All-to-All通信。在这一场景中,会产生大量高频并发的小消息。scaleFabric的IBGDA能够很好地满足这类通信需求,这是它非常重要的应用方向。
万伟指出,IBGDA目前主要应用于MoE通信,特别是MoE All-to-All场景。这类场景的特点是高频、大量、并发的小消息通信,非常适合使用IBGDA。MoE也基本成为大模型的标配架构,因此这类通信在模型运行过程中出现的频次较高,这也是曙光采用IBGDA的重要原因。而对于一些传统通信场景,例如低频、顺序传输大块数据,瓶颈可能出现在存储或计算环节,IBGDA的收益就不会那么明显。
此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。目前,scaleFabric已经完成与DeepEP等通信框架的适配,进一步完善了面向大模型的软件生态,推动IBGDA融入现有应用环境。
从实际效果看,这些场景都需要采用分布式推理架构,也都可能广泛应用IBGDA。至于TTFT能优化多少,与整体架构、具体场景、采用的模型以及GPU Kernel优化等因素密切相关。万伟强调,曙光做过大量测试,效果较好时,整体性能大约可以提升20%至30%。这不仅是IBGDA的贡献,也是联合开展多方面优化的总体成果。具体效果也与模型和应用场景有关。如果整体瓶颈集中在通信环节,网络优化贡献的比例就会更大;如果瓶颈出现在计算或其他环节,网络优化带来的改善会相对较少。
在PD分离场景下,Prefill完成后需要把大量KVCache传递给Decode节点。上下文越长,KVCache的数据量越大,网络传输在TTFT中的占比也就越高。在这种情况下,scaleFabric的低时延和高带宽优势会体现得更加明显。这一过程也会受到存储性能、HBM访问性能、Decode计算等因素影响,具体改善幅度需要结合模型、并发度等条件。
生态与未来:开放架构、系统级创新与集群化标配
从产业层面看,IBGDA在scaleFabric中的规模化应用,对国产AI计算基础设施的自主迭代和性能升级具有重要意义。万伟表示,IBGDA本身是一种软件优化手段,需要针对不同的国产算力卡逐一适配,让算力卡能够直接访问网络。scaleFabric网络可以支持不同的异构算力平台。
制约国产算力发展的一个重要因素,是无法采用部分国外高端计算卡。国产算力卡与国外产品的单卡算力仍有差距。在这种情况下,国内AI基础设施的重要发展方向,是通过系统级创新提升整体性能,与国外依靠先进工艺获得的单卡性能竞争。国内算力发展正在依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率,满足大模型发展所需的算力要求。采用多卡方式构建集群后,多卡之间的数据通信就成为提升整体计算效率的关键因素。IBGDA技术在scaleFabric中的规模化应用,将成为提升多卡效率的重要支撑。
对于网络与存储的全程优化是否会成为AI计算集群标配,万伟认为会。未来AI计算一定会向集群化发展,这是必然要走的一条路。在这一过程中,低时延网络和高性能存储都会成为标配。
面向未来十万卡集群、前沿AI模型和产业生态适配,scaleFabric后续最基础的演进方向,是向更高带宽和更高交换容量发展。下一代将推出800G网络产品和网卡,同时支持更高的交换容量,从而在组网时实现更好的性价比。技术方面还会支持多平面、包喷洒等能力,进一步提高网络通信性能。下一代产品会支持更多优化的拥塞控制算法,提供更好的用户可配置能力。
同时,scaleFabric会保持现有的免维护网络管理优势,以及链路故障后的路由快速恢复能力。随着集群规模扩大,未来挑战仍然包括网络整体稳定性,既要考虑性能,也要考虑全局稳定性,包括长尾时延和故障恢复。
在生态方面,中科曙光北京公司scaleFabric产品经理纵瑞博补充,在AI生态方面,曙光采用开放架构。后续希望让scaleFabric网络与更多国产厂商的产品完成适配和优化。在RoCE和NVIDIA InfiniBand之外,为产业提供高性价比的国产原生无损RDMA网络方案,为各类GPU、CPU及其他硬件厂商提供技术支撑。曙光网络技术全部自主开发,包括对IBGDA等先进架构的支持。因此,能够与GPU、CPU和其他硬件厂商开展协同开发,在AI生态中更好地服务用户,加速Token生成,提供更高效的技术方案。曙光也希望与产业伙伴共同建设网络生态。
在改造成本方面,万伟表示,IBGDA是一项软件技术。在部分国产生态和NVIDIA生态中,曙光已经完成适配,可以直接使用。用户启用支持IBGDA的通信库即可。如果其他国产加速卡需要使用,曙光也可以提供参考代码。从代码实现来看,有了参考以后,改造难度不高,主要是适配工作量的问题。曙光已经在NVIDIA和部分国产平台上跑通,因此整体风险可控。
纵瑞博进一步补充道,对于上层应用来说,这一能力是无感的。只要基于DeepEP框架,就不需要修改业务代码或上层框架,可以直接运行。底层适配方面,曙光已经完成NVIDIA GPU的适配;与其他GPU厂商合作时,还需要对底层代码和相关功能进行适配,但这些工作对上层软件不可见。对上层应用来说,使用方式完全一致,可以直接运行。
写在最后:
Token效率正在成为大模型竞争的新标尺。中科曙光scaleFabric Token加速技术体系,以原生无损RDMA为底座,把计算、存储、网络三者紧密耦合,试图打通Token在训练、推理、存储全链路中的高速流转通道。而IBGDA在国内首次规模化落地,则让GPU能够更直接地驱动网络,在MoE等高频小消息通信场景中减少CPU参与关键通信路径,为国产智算基础设施通过系统级创新提升整体性能提供了新的支点。
正如万伟所言,未来AI计算一定会向集群化发展,低时延网络和高性能存储都会成为标配。随着下一代800G产品、更高交换容量、多平面和包喷洒等能力推进,以及9月中下旬大规模PD分离推理场景实验测试报告的发布,scaleFabric与IBGDA的后续表现,值得产业持续关注。
声明:本文转载自51CTO,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!