星光澄海 | BLOG

SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference

AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08

针对大语言模型(LLM)解码阶段内存瓶颈导致延迟的问题,现有剪枝方法存在分布偏移及对解码核心SpMV优化不足的缺陷,提出SparseDecoding框架,通过生成式校准矩阵对齐剪枝目标,开发优化的稀疏矩阵向量内核,在多款LLM上实现性能提升与解码加速。

标签:AI情报、大模型

查看原文


由 WeValue AI 产业情报引擎自动同步

发表第一条评论吧

支持 Markdown