星光澄海 | BLOG

TokenRouter:让token级LLM路由效率提升2到64倍?

TokenRouter在多种路由算法、工作负载和模型配对下,解码吞吐量是现有系统的2.01到64.15倍——这是arXiv上一篇cs.CL分类的论文给出的实测结果。

现存token级LLM路由服务的核心痛点

LLM路由本来是把推理任务分配给不同模型,说白了就是给服务的成本和质量平衡点做优化。之前生产里用的多是会话或查询级的粗粒度路由,最近算法层面发现细粒度的token级路由能带来更大的效率和质量增益。但问题来了:现有系统都是基于单LLM假设设计的,跑token级路由的时候,会出现严重的步骤不同步、批量准入延迟高的问题,还会给开发者带来很高的实现复杂度。比如开发者得自己搞定不同模型的步骤对齐,还得处理批量请求的延迟,这些额外工作已经够麻烦了,还要适配不同的路由算法和模型配对,复杂度可想而知。

TokenRouter的解法:请求视角+模型执行的分工

TokenRouter就是针对这些问题设计的,主打高效、开发者友好的token级LLM推理服务系统。它的核心设计原则是“请求视角编程,模型执行调度”——开发者不用纠结底层的模型细节,只需要从单个请求的角度描述路由逻辑就行;运行时会自动给每个LLM启动一个子服务器,异步分发请求。每个子服务器用的是延迟批量调度器,这个调度器的最优超参数是通过系统吞吐量的数学模型推导出来的,不是靠反复试错凑出来的。论文里没展开讲推导细节,但强调这个设计在各种场景下都能稳定生效。

对行业的实际影响

光说设计没用,得看实测结果。论文里测了不同情况:换不同的路由算法、换不同的工作负载、换不同的模型配对,TokenRouter的解码吞吐量都比现有系统高,倍数范围是2.01到64.15倍,跨度大也说明适配性够广。还有个关键信息:代码是开源的,github地址是https://github.com/thu-nics/TokenRouter,感兴趣的可以去扒细节。对做LLM服务的团队来说,这个系统解决了token级路由落地的几个核心障碍:效率低、实现难,不用开发者从零搭建复杂的调度逻辑,只要按请求视角写路由就行,省了不少事儿。

TokenRouter的出现,算是把token级LLM路由的落地门槛降了一大截,实测的效率提升也够实在。那问题来了:token级路由本来就有算法优势,现在TokenRouter把服务层的坑填上了,会不会让更多之前只敢用粗粒度路由的厂商,开始尝试token级的方案?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、开源生态
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown