星光澄海 | BLOG
有点子了,就去执行……
PHRBench:测LLM在幻觉后怎么修正错误
4820个受控测试实例里,大语言模型从幻觉中成功修正错误的情况,比多数人想的少。这是arXiv上cs.CL和cs.AI分类的一篇新研究,搞了个叫PHRBench的基准,专门盯着LLM“幻觉后推理...
2026-10-07 0 0 人工智能/应用
MemoCare:用手机就能做的自动认知筛查系统
MemoCare的绘图模块,在锁定的71张图像测试集上,平均平衡准确率达到91.33%——这是一款主打自动认知筛查的多模态移动系统交出的测试答卷。它是什么?MemoCare是一款交互式移动端应用...
2026-10-07 0 0 人工智能/应用
解决推测解码训练痛点:直接优化期望解码轮次
现在用推测解码提速大模型推理,但训练并行草稿模型的核心矛盾一直没解决——之前的训练目标都是“凑局部损失”,根本不管全局解码要跑多少轮。之前的训练是“盲人摸象”并行草稿模型(比如业内常用的DSpa...
2026-10-07 0 0 人工智能/应用
RobotWorld基准测试:智能体在物理机器人上的表现差在哪?
RobotWorld给智能体测了84个机器人任务,结果打破了不少人对通用智能体的期待——那些能写代码、搞定复杂数字任务的模型,到了物理世界就容易掉链子。RobotWorld测的不是虚的,是真的机...
2026-10-07 0 0 人工智能/应用
Meta推出新AI工具 检测藏在普通广告中的有害内容
Meta近期排查平台内容时,发现部分看似正常的广告——比如标注为“限量潮鞋”“线下体验课”的推广——实际跳转至其他站点的有害内容页面。新工具针对的是跨站的广告陷阱之前Meta的广告审核,只盯站内...
2026-10-07 0 0 人工智能/应用
模型说谎时,推理token数会莫名变多?
三个主流推理型大模型,答完210道覆盖多类型的选择题,一个容易被忽略的信号被抓出来了——说真话时用的推理token数量,明显比指令说谎、不关心对错的情况少得多。绕开“看不懂的推理链”,找低带宽信...
2026-10-07 0 0 人工智能/应用
解决交错图文生成难题:一种训练免费的自校正优化
多模态大模型生成交错图文内容时,之前的方案普遍要靠额外数据训练,计算成本高,还常出现视觉主体丢失、时序混乱、物理逻辑不合理的问题。新提出的SCO方法不用额外训练,在挑战性基准测试中,时序一致性和...
2026-10-07 0 0 人工智能/应用
RoboQuest基准:通用物理机器人的探索困境
在RoboQuest基准测试里,目前最好的多模态物理代理,任务成功率才23%。RoboQuest要解决的真问题多模态基础模型发展到现在,已经能完成不少操作任务,成了所谓“通用物理代理”。但有个实...
2026-10-07 0 0 人工智能/应用
爱沙尼亚语文档简化:大模型表现差距明显
正文:爱沙尼亚语是种形态极其复杂的低资源语言,直到最近,它的文档级文本简化研究几乎是空白——这是一篇cs.CL分类的arXiv论文抛出来的事实。研究到底测了啥?文档级文本简化和改单个句子完全两码...
2026-10-07 0 0 人工智能/应用
TaoD2C-Bench:测MLLM UI代码生成,不止看视觉
2861个来自17家商业平台的真实UI生产设计,97652条专家标注,这是刚在arXiv公开的TaoD2C-Bench基准数据集的全部家底——它专门测多模态大模型(MLLM)的UI代码生成能力,...
2026-10-07 0 0 人工智能/应用