结构化稀疏被认为是提升大模型推理效率的重要方向之一。为了支持这类计算模式,如今的GPU 中引入了稀疏张量核(Sparse Tensor Core),能够为 2:4 结构化稀疏提供最高 2 倍的矩阵运算吞吐。其中,2:4 稀疏要求每 4 个连续权重中恰有两个为零。尽管这一机制具备显著的加速潜力,但 50% 的剪枝率对于大语言模型而言往往过于激进,即使经过微调,仍可能带来明显的精度损失和能力退化。
而 6:8 等温和稀疏模式则能够在保持模型能力的同时实现有效压缩。但是,6:8 虽然保持了模型能力,却无法获得硬件加速。当前稀疏张量核仅支持 2:4 这一种格式,不符合该格式的稀疏权重只能回退到稠密计算。也就是说,6:8模型中 25% 的零元素在推理时并未带来任何计算或带宽上的节省——算法层面的稀疏优势无法转化为部署上的实际收益。在量化精度已经覆盖了从 16 bit 到4 bit 的丰富选择的同时,稀疏方向上,50% 与 0% 之间存在一大片尚未被硬件覆盖的空白地带。
近日,微软亚洲研究院提出了 SlideSparse,首次在 NVIDIA GPU 上使 6:8、4:6、8:10 等温和稀疏模式也能利用稀疏张量核加速,为这一长期存在的技术空白提供了解决方案。相关论文已被ICML 2026 接收。

论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。
滑动窗口分解:让温和稀疏适配稀疏张量核
SlideSparse 的基本思路是将不满足2:4 约束的稀疏块,分解为若干满足 2:4 约束的重叠子块。研究员们将这一策略称为”计算套利”(Computational Arbitrage),通过适度的数据膨胀换取硬件层面的加速能力,从而释放稀疏张量核的计算潜力。
以 6:8 稀疏为例,一个长度为 8 的权重块中包含6 个非零元素和两个零元素。由于两个零元素的位置可以任意分布,因此无法直接拆分为两个符合 2:4 约束的子块。
对此,SlideSparse采用滑动窗口策略:使用 3 个大小为 4、步长为 2 的窗口依次滑过这8 个元素(第一个窗口覆盖位置 0-3,第二个覆盖 2-5,第三个覆盖 4-7)。相邻窗口之间共享两个位置。当某个窗口内的非零元素超过两个时,多出的非零元素恰好位于与下一个窗口的重叠区域内,则可以被下一个窗口容纳。这一过程本质上利用了经典的“抽屉原理”,可确保所有非零元素均能被合理分配。

经过变换后,原本的8 个元素扩展为 12 个,维度膨胀1.5 倍。但与此同时,所有生成的子块均满足 2:4 约束,可以直接由稀疏张量核执行。由于硬件能够提供两倍吞吐,因此最终可获得约1.33倍的理论加速比。论文进一步证明,对于任意 (2N−2):2N 稀疏模式,采用N−1 个滑动窗口既是充分条件也是必要条件,因此这一膨胀因子已经达到理论最优。
值得注意的是,权重侧的滑动变换在离线阶段完成,不会增加推理开销。输入侧所需的对应重排操作(Activation Lifting),本质上只是索引映射。研究员们将其融合至推理过程中已有的逐token 量化 kernel 内,实现了极低的额外开销。而整个系统都集成于vLLM 推理框架中,仅需少量修改即可启用。
将稀疏扩展为新的推理优化维度
过去几年,大模型推理加速主要沿着量化方向持续演进:从 16 bit、8 bit,到4 bit 甚至更低精度,各类压缩配置均逐步获得硬件支持。
相比之下,稀疏优化的发展长期受到硬件约束。目前主流 GPU 仅支持 2:4 稀疏格式,使得开发者不得不在“无稀疏”和“50%剪枝”之间进行二选一。但25%、33% 等温和稀疏比例往往能够更好地兼顾模型性能与压缩率,因此一直被认为是极具潜力的设计空间。
SlideSparse 的出现改变了这一局面。通过将更多稀疏模式映射到稀疏张量核上执行,SlideSparse将稀疏优化从过去的两个极端状态扩展为一系列可灵活选择的配置,使稀疏压缩真正成为与量化压缩并列的重要推理优化维度。

量化与稀疏本质上是两个相互独立的优化方向,可以组合使用。在未来的大模型部署过程中,开发者不仅可以调整计算精度,还能够根据任务需求灵活选择不同稀疏比例,实现更加细粒度的性能-效率权衡。
跨平台验证 SlideSparse 的加速能力
为验证方案的通用性,研究员们对SlideSparse 在 6 款GPU(A100、H100、B200、RTX 4090、RTX 5080、DGX Spark)、5 种精度(FP4、INT8、FP8、BF16、FP16)、5 个模型(Llama3.2-1B/3B、Qwen2.5-7B/14B、BitNet b1.58 (2B))上进行了评测,覆盖数据中心、消费级和嵌入式三类平台。

实验结果表明,在计算密集的 Prefill 阶段,6:8 稀疏能够充分发挥稀疏张量核的计算能力。在A100 上,Qwen2.5-7B模型实现了 1.33倍的端到端加速,与理论上限高度一致。
在消费级 GPU 上,SlideSparse 同样展现出稳定收益。例如,在RTX 4090 的 FP8 配置下,6:8 稀疏可实现约 1.18~1.19倍的加速。Decode阶段由于受到访存瓶颈限制,加速幅度相对较小,但仍可获得 1.07~1.21倍的性能提升。
在实际服务场景测试中,Qwen2.5-14B模型的首 token 延迟由390 ms 降低至 291 ms,进一步验证了SlideSparse 的实际部署价值。
研究员们还对系统效率进行了深入分析。通过对比实测结果与理论预期发现,多数配置下的整体效率均超过 100%,表明融合 kernel 的设计有效消除了滑动变换带来的额外开销,并在部分硬件平台上进一步释放了潜在性能。

重新释放温和稀疏的部署潜力
稀疏张量核是现代 GPU 中重要的硬件加速能力,但其应用长期受限于 2:4 结构化稀疏这一单一格式。对于能够更好兼顾模型性能与压缩率的温和稀疏配置而言,硬件支持始终存在缺口。
SlideSparse 通过创新性的滑动窗口分解机制,将稀疏张量核的适用范围扩展至整个(2N−2):2N 稀疏家族,为温和稀疏提供了切实可行的硬件加速路径。该工作不仅拓宽了结构化稀疏的应用边界,也使稀疏压缩与量化压缩一样,成为大模型推理优化中可灵活调节的重要维度。
相关代码现已开源,并集成于 vLLM,欢迎尝试、交流。
SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity (ICML 2026)
论文链接:https://arxiv.org/abs/2603.05232 (opens in new tab)
代码链接:https://github.com/bcacdwk/vllmbench (opens in new tab)