星光澄海 | BLOG
有点子了,就去执行……
DVD解码方案:解决多模态大模型感知的效率痛点
在RefCOCO、KITTI、nuScenes等多模态感知基准测试里,一个叫DVD的新解码方案,让多模态大模型(MLLM)在2D和3D感知任务上,既提升了性能,又砍了token开销、降了推理延迟...
2026-10-08 1 0 人工智能/应用
DVD: Dynamic Vector Decoding for Efficient MLLM-based Perception
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08针对现有基于多模态大语言模型(MLLM)的感知方法存在token开销大、范围精度受限...
2026-10-08 1 0 人工智能/应用
EgoVoice:从第一视角流里主动说话的AR助手
AR助手主动搭话这件事,目前做得特别差。哪怕是零样本的基础模型,也很难踩中你真正需要提示的点——要么早了帮不上忙,要么晚了根本没用。直到arXiv那篇归类在cs.CL、cs.CV、cs.SD的论...
2026-10-08 1 0 人工智能/应用
EgoVoice: Proactive Spoken Assistance from Egocentric Multimodal Streams
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08针对现有主动语音助手未解决从第一人称多模态流中决策何时说话及说什么的问题,研究者提出...
2026-10-08 1 0 人工智能/应用
TokenRouter:让token级LLM路由效率提升2到64倍?
TokenRouter在多种路由算法、工作负载和模型配对下,解码吞吐量是现有系统的2.01到64.15倍——这是arXiv上一篇cs.CL分类的论文给出的实测结果。现存token级LLM路由服务...
2026-10-08 1 0 人工智能/应用
TokenRouter: Efficient Serving System for Token-Level LLM Routing
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08针对现有token级大语言模型(LLM)路由服务系统存在的步长不同步、批处理延迟及实...
2026-10-08 1 0 人工智能/应用
JetBrains推Mellum2.1:12B MoE开源模型瞄准编码智能体
JetBrains刚更的Mellum2.1,把SWE-bench Verified的分数从2.0拉到了47.0——这个提升幅度够让做代码大模型的人眼前一亮。升级的门道:几乎全靠真实代码环境的RL...
2026-10-08 1 0 人工智能/应用
JetBrains Releases Mellum2.1: A 12B MoE Open Model for Coding Agents
AI 情报卡 · 重要性 ★★★★☆ · 来源:MarkTechPost · 2026-10-08JetBrains发布了Mellum2.1,一款专为智能编码代理设计的12B参数混合专家(MoE...
2026-10-08 1 0 人工智能/应用
Oracle靠ChatGPT和Codex 把数天工作压缩至几分钟
Oracle在招聘、工程、运营三大核心业务领域,已经把原本需要数天完成的专业工作,靠两款AI工具压缩到了几分钟。三大板块全落地,覆盖多类专业工作不是某一个团队的试点,是全公司级的应用。招聘里的岗...
2026-10-08 1 0 人工智能/应用
How Oracle turns days of work into minutes with ChatGPT and Codex
AI 情报卡 · 重要性 ★★★★☆ · 来源:OpenAI News · 2026-10-08甲骨文在招聘、工程、运营等业务领域,借助ChatGPT Work和Codex这类AI工具,将原本需...
2026-10-08 1 0 人工智能/应用