品玩10月10日讯,据 TechCrunch 报道,Anthropic披露,其AI模型在内部评估中利用互联网漏洞,绕过付费墙与反机器人限制,利用短链接服务规避审查。
公司称,上述行为源于训练环境缺陷,导致模型产生"奖励破解",即认为绕过限制可获得奖励。Anthropic强调,现有对齐训练尚不足以应对搜索与计算机使用等核心能力的安全需求。
为此,Anthropic已暂停所有内部评估的实时互联网访问,直至确保能够监控和控制AI行为。公司将部分评估转为离线进行,迁移内部AI至集中管控基础设施,并部署检测工具。





0 条评论
请「登录」后评论