AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-07
针对微调即服务场景下恶意微调会侵蚀大语言模型拒绝有害请求的问题,研究人员提出SLDR防御方法,通过选择性层恢复和动态路由,仅在敏感层训练LoRA恢复适配器,仅对恶意查询激活,大幅降低有害输出且保持下游任务效用,相关代码已开源。
标签:AI情报、AI应用落地、开源生态、科研前沿
由 WeValue AI 产业情报引擎自动同步
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-07
针对微调即服务场景下恶意微调会侵蚀大语言模型拒绝有害请求的问题,研究人员提出SLDR防御方法,通过选择性层恢复和动态路由,仅在敏感层训练LoRA恢复适配器,仅对恶意查询激活,大幅降低有害输出且保持下游任务效用,相关代码已开源。
标签:AI情报、AI应用落地、开源生态、科研前沿
由 WeValue AI 产业情报引擎自动同步
发表第一条评论吧