星光澄海 | BLOG

EAServe: Encode-Aware Disaggregated Serving for Multimodal Large Language Models

AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-09-25

针对多模态大语言模型(MLLMs)三阶段服务的资源失衡问题,研究人员提出EAServe框架,通过运行时微批处理、部分卸载及SM分区等技术,结合混合自动选择配置层,在三种MLLM架构上实现更高吞吐量,优化了GPU利用率。

标签:AI情报、大模型、AI芯片与算力、科研前沿

查看原文


由 WeValue AI 产业情报引擎自动同步

发表第一条评论吧

支持 Markdown