现在做电磁频谱监测的,没人再满足于只做特定信号的识别或检测了——要灵活分析不同场景的信号。但卡在一个核心问题:怎么把原始I/Q信号转成大模型能懂的token,同时不超“预算”。
原来的信号分词有两个死穴
之前的方案逃不出两个坑:要么用密集编码,信号越长,需要的token数量直接往上跳,成本和时间都跟着涨;要么用固定分辨率压缩,把信号统一压成固定长度,结果短时间的脉冲、局部的弱信号,直接被当成冗余信息删掉了,有用细节全丢。相当于要么“贪多嚼不烂”,要么“一刀切丢关键”。
BATok的自适应预算解法
arXiv上cs.AI和eess.SP分类的这篇研究,直接递了个新方案:BATok,预算自适应信号分词器。
它的逻辑其实很直白:先给原始信号做多分辨率分支的特征提取——简单说就是从不同颗粒度抓信号的关键特征;然后结合“局部能量先验”(就是信号里能量高的地方大概率是核心),再加可学习的查询,把这些特征重采样成紧凑的token。最关键的两点:一是token数量会跟着输入信号的长度自动调整,但全程有严格的预算上限,不会无限制堆;二是最后生成的token会投影到视觉语言模型(VLM)的语言嵌入空间,相当于直接对接现有大模型的接口,不用改模型本身,兼容性够强。
配套数据集打通指令对接
光有分词器还不够,得有能教模型“读懂指令”的训练数据。研究团队配套做了EMSpec-Instruct数据集:把原始I/Q信号、电磁频谱常用的瀑布图,和自然语言指令对齐,覆盖三类任务:调制识别(比如判断是5G还是Wi-Fi信号)、结构化检测(定位信号里的特定事件)、语言条件信号接地(比如用“找1.2G频率的弱脉冲”这种指令,让模型精准定位)。这个数据集相当于给模型喂了跨模态的“翻译手册”,让信号和自然语言能对上。
实验结果也符合预期:BATok生成的信号表示很有效,在所有任务上的表现都有竞争力。现在这篇研究还挂在arXiv上,没到落地阶段,但这个思路踩中了电磁频谱分析的痛点——既要灵活,又要控成本。
那会不会有通信厂商或者雷达厂商,先把这个方案用到自己的频谱分析工具里?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI基础设施、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧