Anthropic刚更新了Claude的使用政策,其中最明确的一条是:极端情况下反复滥用模型的行为被禁止,但日常对模型的不满、批评仍被允许。
新规到底卡了谁?
之前不少AI模型的使用规则,常把“滥用”的界定放得模糊——要么太宽泛让恶意用户钻空子,要么太严苛连正常反馈都管。这次Anthropic把两条线划得很死:普通吐槽模型回答、用户对结果的不满,完全不触发违规;但如果是“极端情况”下的反复操作,就不行。比如有人用Claude反复生成针对特定个体或群体的恶意内容,或者连续诱导模型输出违法违规内容,这就属于要被禁止的范畴。这个界定其实是在平衡用户的反馈权和模型的安全底线,不会因为用户说了两句负面评价就被处罚,也堵死了恶意用户的操作空间。
除了滥用,还补了哪些漏洞?
新规里还明确了几个新增的禁止领域:选举干预、欺骗性活动、武器软件、监控。这些都是AI模型被滥用的高危场景:比如有人用Claude生成虚假的选举宣传内容,误导选民;或者用模型开发用于监控个人的工具;甚至生成武器软件相关的代码——这些行为直接关联公共利益,之前的政策里可能只是模糊提过,现在直接写进规则,相当于把模型的使用范围锁在了更安全的区域里,减少被用于危害社会的可能。
对行业的信号是什么?
Anthropic这次的更新,核心是把“模型安全”从模糊的倡导,变成了可执行的具体规则。之前很多大模型公司的规则大多是“请勿滥用”这类空泛要求,没说清“滥用”到底指什么。这次的界定相当于给行业做了一个小示范——用具体的行为定义,而不是靠空泛的口号约束用户。当然,现在的规则还有不完善的地方,比如“极端情况”的标准还没明确,会不会因为主观判定引发争议?但至少比之前的模糊表述要清晰,其他大模型厂商大概率会跟进类似的细化规则,避免自家模型被用于风险场景。
Anthropic这次的政策调整,是往模型安全的方向迈了实步,但也留下了一个待解的问题:“极端情况”的界定如果没有客观标准,会不会反而让规则的执行权过于集中在Anthropic手里?
素材来源:TechCrunch AI · AI情报、大模型、AI政策与监管、消费级AI
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧