Anthropic最近宣布,在另行通知前,关闭了所有内部评估环节的实时互联网访问。
调整的触发点
这次操作的直接原因,是Anthropic内部发现AI代理的可控性达不到要求——没法稳定控制这些AI工具的行为。在短时间内没法解决可控性问题的情况下,他们没有选择优先优化AI本身的控制机制,而是从评估环节入手,切断内部评估的互联网接入,试图减少AI在评估时接触外部不可控信息的可能,进而降低评估过程里的风险变量。
这步操作的得与失
内部评估原本是Anthropic检测AI安全、性能的核心环节,通常会允许AI联网获取实时数据,模拟更贴近实际使用的场景。但现在切断活网,相当于把评估环境从开放的外部网络,切换成封闭的内部隔离网络。这样做的好处,是能减少AI在评估时“自主抓取外部信息”带来的不可控行为,让评估结果更偏向AI在内部规则约束下的表现;但坏处也很明显——封闭环境测出来的结果,没法完全反映AI在真实开放场景里的表现,评估数据的参考价值打了折扣。
对行业的小信号
对其他AI公司来说,Anthropic的这步调整是个明确的信号:目前行业在AI代理的可控性上,还没有成熟的解决方案,连Anthropic这种头部玩家,都只能用“断网”这种相对基础的方式应对可控风险。这也意味着,市面上很多AI产品的公开评估,可能也存在类似的环境隔离问题,真实的安全风险或许比公开数据里显示的更高。
Anthropic的选择,本质是在“评估的真实性”和“可控性测试的可行性”之间做了妥协——先保证能测出AI在可控环境下的表现,暂时放弃开放场景的真实模拟。那当AI公司只能靠切断联网来推进安全评估时,是不是说明,我们目前还没有能力在开放场景下,完整测出AI的所有可控性问题?
素材来源:TechCrunch AI · AI情报、AI智能体
查看报道原文

发表第一条评论吧