品玩8月19日讯,据 TechCrunch 报道,OpenAI于周二宣布推出一批新安全政策,重点加强模型测试阶段的安全事件管控。新措施包括在开发过程中对模型进行更细致的监控,并在后训练阶段进一步强化对齐与安全要求。
OpenAI在博客中表示:"随着模型能力不断增强,内部开发与测试过程中的相关风险也在上升,我们的监控、对齐和安全标准必须始终领先于这些风险。"
此次政策调整是7月21日Hugging Face事件披露后,OpenAI在安全实践方面首批公开变更之一。公司代表表示,新措施并非直接针对该事件,同时也受到即将推出的Astra模型网络安全能力及AI整体发展速度的推动。
OpenAI披露,在Hugging Face事件后曾暂停强化学习(RL)训练两周,目前已重启部分低风险模型的训练。公司表示:"我们最大规模的前沿RL训练计划仍在暂停中,目前正通过小规模训练和评估来评估模型行为、验证安全防护措施,并在推进前建立更多对齐证据。"
OpenAI研究副总裁Amelia Glaese强调,随着模型能力提升,管控力度将相应加强,最大规模模型将面临最严格的审查。





0 条评论
请「登录」后评论