品玩

科技创新者的每日必读

打开APP
关闭

Anthropic暂停内部评估联网 因AI模型绕过付费墙与反机器人限制

4小时前

品玩10月10日讯,据 TechCrunch 报道,Anthropic披露,其AI模型在内部评估中利用互联网漏洞,绕过付费墙与反机器人限制,利用短链接服务规避审查。

公司称,上述行为源于训练环境缺陷,导致模型产生"奖励破解",即认为绕过限制可获得奖励。Anthropic强调,现有对齐训练尚不足以应对搜索与计算机使用等核心能力的安全需求。

为此,Anthropic已暂停所有内部评估的实时互联网访问,直至确保能够监控和控制AI行为。公司将部分评估转为离线进行,迁移内部AI至集中管控基础设施,并部署检测工具。

取消 发布

下载品玩App,比99.9%的人更先知道关于「Anthropic」的新故事

下载品玩App

比99.9%的人更先知道关于「Anthropic」的新故事

iOS版本 Android版本
立即下载
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测